목록2026/05/19 (2)
co-code 님의 블로그
K - Means ( 평균을 이용한 군집화 )k개의 자동 분류하는 비지도 학습 알고리즘종속 변수가 존재하지 않는 데이터에서 유사한 데이터끼리 모음서로 가까운 데이터는 같은 그룹으로 묶어서 그룹화그룹의 중심점을 반복적으로 계산(중심점의 이동)하여 군집을 형성작업 순서초기의 중심점(k개)을 선택각각의 데이터들을 중심점과의 거리를 확인가까운 거리를 중심점으로 할당각 군집의 평균을 구해서 새로운 중심점을 설정중심점의 변화가 거의 없을 때까지 반복 실행장점 : 빠르고 단순하여 대용량의 데이터에서 적합단점군집의 수를 미리 알고 작성해야 함이상치에 굉장히 민감함parametern_clusters기본값 : 0군집의 개수를 지정너무 작거나 큰 경우에는 성능 저하init기본값 : 'K-Means++'초기의 중심점을 설정하..
PCA차원 축소 기법 : feature의 개수가 줄어든다.고차원 데이터(다수의 feature를 가진 데이터셋)를 상관관계가 없는 새로운 축으로 변환데이터의 분산을 최대한 보존하면서 차원을 줄여서 시각화parameter(매개변수)n_components기본값 : None주성분의 개수 또는 비율로 설정None : 모든 주성분을 유지int : 선택할 주성분의 개수 float(0 ~ 1) : 누적 설명 분산 비율을 기준으로 필요한 주성분의 개수를 선택'mle' : 자동으로 최적 차원의 수 측정 (샘플의 개수 whiten기본값 : False주성분 벡터를 단위 분산으로 정규화를 할 것인가 지정데이터의 정규화 효과svd_solver기본값 : 'auto'분해 방식 지원'auto' : 데이터의 크기에 따라서 자동 선택'f..