비지도학습 (2)
머신러닝|조회 1|2026.09.14 17:53
0:00 / 51:59
비지도학습 (2)
51:59비지도 학습 (2): 군집화와 K-Means 심층 분석
본 영상은 비지도 학습의 핵심 기법 중 하나인 군집화, 특히 K-Means 알고리즘을 심도 있게 다룹니다. 실제 금융 데이터(주식 수익률)를 예시로 사용하여 K-Means 알고리즘의 작동 방식, 데이터 전처리(스케일링)의 중요성, 그리고 군집화 결과의 평가 및 해석 방법을 상세히 설명합니다.
학습 목표
- K-Means 알고리즘의 원리를 이해하고 실제 데이터에 적용할 수 있습니다.
- 데이터 스케일링(표준화)이 군집화 성능에 미치는 영향을 파악하고, 외부 요인(시장 수익률) 제거의 중요성을 이해합니다.
- 군집화 결과의 타당성을 평가하기 위한 다양한 지표(Elbow Method, Silhouette Score, Davies-Bouldin Index)를 학습하고 해석할 수 있습니다.
- 군집화 결과와 도메인 지식(섹터 분류)을 결합하여 의미 있는 인사이트를 도출하는 방법을 배웁니다.
핵심 개념
- 군집화(Clustering): 유사한 데이터 포인트들을 그룹으로 묶는 비지도 학습 기법입니다. K-Means는 대표적인 군집화 알고리즘 중 하나입니다.
- K-Means 알고리즘: 데이터를 K개의 군집으로 나누고, 각 군집의 중심(Centroid)을 반복적으로 업데이트하여 군집을 형성하는 알고리즘입니다.
- 데이터 스케일링(Data Scaling): 서로 다른 범위의 특성(feature) 값을 갖는 데이터를 일정한 범위로 조정하는 과정입니다. K-Means에서는 변동성이 큰 특성이 군집 형성에 과도한 영향을 미치는 것을 방지하기 위해 중요합니다. 영상에서는 주식 수익률 데이터에서 시장 수익률(외부 요인)을 제거하는 스케일링 기법을 다룹니다.
- 군집 평가 지표:
- Elbow Method (엘보우 방법): 군집의 개수(K)에 따른 오차(inertia)를 그래프로 그려, 오차가 급격히 줄어드는 '팔꿈치' 지점을 찾아 최적의 K를 결정하는 방법입니다. 오차가 완만하게 줄어드는 지점을 찾습니다.
- Silhouette Score (실루엣 계수): 각 데이터 포인트가 속한 군집 내의 다른 데이터와의 유사도(응집도)와 다른 군집의 데이터와의 거리(분리도)를 종합적으로 평가하는 지표입니다. 1에 가까울수록 좋으며, 군집 내 응집도가 높고 군집 간 분리가 잘 되어 있음을 의미합니다.
- Davies-Bouldin Index (DBI): 각 군집의 중심 간 거리와 군집 내 분산의 비율을 계산하여 군집의 분리도를 평가합니다. 값이 낮을수록 군집 간 분리가 잘 되어 있음을 의미합니다. 0에 가까울수록 좋습니다.
- 교차표(Cross-tabulation) 및 히트맵(Heatmap): 군집화 결과와 실제 레이블(섹터) 간의 관계를 시각화하여 군집의 타당성을 평가하는 데 사용됩니다.
공부 방향성
본 영상은 K-Means 알고리즘의 이론적 배경부터 실제 적용, 그리고 결과 해석까지 포괄적으로 다룹니다. 특히, 데이터의 특성을 이해하고 적절한 전처리 및 평가 방법을 선택하는 것이 비지도 학습의 핵심임을 강조합니다. K-Means 외에도 다양한 군집화 알고리즘과 평가 지표가 존재하므로, 본 영상 학습 후에는 다른 알고리즘(DBSCAN, 계층적 군집화 등)과 평가 지표에 대한 추가 학습을 병행하면 더욱 깊이 있는 이해를 할 수 있습니다. 실제 문제 해결에 비지도 학습을 적용할 때는 반드시 도메인 지식을 활용하여 결과를 해석하고 검증하는 과정이 필수적임을 기억하십시오.