분류랑 평가 (4)
머신러닝|조회 3|2026.09.10 17:33
분류랑 평가 (4)
12:45분류 모델 성능 평가 주요 개념
이 영상에서는 분류 모델의 성능을 설명하고 평가하는 데 사용되는 주요 개념들을 알아봅니다.
특히 다음 내용을 명확히 이해하는 것을 목표로 합니다.
- 피처 중요도
- 데이터 누수
- 모델 설명력
- 분류와 회귀 모델의 차이점
- 더미 모델
- K-Nearest Neighbors (KNN)
- 배깅과 부스팅
- 불균형 데이터
- 혼동 행렬(Confusion Matrix)
- 정밀도(Precision)와 재현율(Recall)
- AUC (Area Under the Curve)
피처 중요도
피처 중요도는 모델이 예측을 위해 특정 피처를 얼마나 중요하게 여기는지를 나타냅니다.
모델 설명의 근거가 될 수 있지만, 인과관계와는 다를 수 있습니다.
또한 연관된 피처가 많으면 중요도가 여러 피처에 분산되어 개별 피처의 중요도가 낮게 보일 수 있습니다.
데이터 누수
**데이터 누수(Data Leakage)**는 학습 데이터에 실제 예측 시점에는 알 수 없는 정보가 포함되는 경우입니다.
데이터 누수가 발생하면 특정 피처의 중요도가 비정상적으로 높게 나타날 수 있으며, 이는 데이터 정제가 필요함을 시사합니다.
모델 인터페이스
Scikit-learn과 같이 모델 이름만 변경하면 학습, 예측, 평가 과정을 동일하게 수행할 수 있는 인터페이스의 중요성도 설명합니다.
이를 통해 여러 모델을 비교하고 실험하는 과정을 보다 쉽게 수행할 수 있습니다.
더미 모델
**더미 모델(Dummy Model)**은 무조건 특정 클래스로 예측했을 때의 성능을 기준으로 삼는 모델입니다.
실제 모델이 더미 모델보다 나은 성능을 내는지를 판단하는 **기준(Baseline)**이 됩니다.
K-Nearest Neighbors (KNN)
**K-Nearest Neighbors (KNN)**는 유사한 K개의 데이터를 찾아 클래스를 예측하는 방식입니다.
K값에 따라 과적합 또는 과소적합이 발생할 수 있습니다.
배깅과 부스팅
앙상블 기법인 **배깅(Bagging)**과 **부스팅(Boosting)**의 차이를 설명합니다.
- 배깅: 병렬 처리
- 부스팅: 순차 처리
불균형 데이터
불균형 데이터는 특정 클래스의 데이터가 압도적으로 많을 때 발생하는 문제와 주의점을 다룹니다.
이러한 데이터에서는 단순한 정확도만으로 모델의 성능을 판단하기 어려울 수 있습니다.
혼동 행렬
**혼동 행렬(Confusion Matrix)**은 정밀도, 재현율 등 다양한 분류 지표의 기준이 되는 행렬입니다.
분류 결과를 기준으로 모델이 어떤 종류의 예측을 얼마나 정확하게 수행했는지 확인할 수 있습니다.
정밀도와 재현율
**정밀도(Precision)**와 **재현율(Recall)**은 예측값 기준이냐 실제값 기준이냐에 따라 달라지는 두 지표의 차이를 설명합니다.
- Precision: 예측값을 기준으로 판단
- Recall: 실제값을 기준으로 판단
AUC
**AUC (Area Under the Curve)**는 임계값 변화에 따른 모델 성능을 종합적으로 측정하는 지표입니다.
보편적인 모델 측정 기준으로 활용됩니다.
분류와 회귀 모델의 구분
문제의 결과를 연속적인 숫자로 표현할 수 있는지에 따라 회귀와 분류를 구분할 수 있습니다.
- 연속적인 숫자로 표현: 회귀 모델
- 클래스 단위로 구분: 분류 모델
학습 전후 권장 사항
영상 시청 전
분류 및 회귀 모델의 기본적인 개념을 복습하면 학습 효과를 높일 수 있습니다.
영상 시청 후
각 평가 지표의 의미와 한계를 이해하고, 실제 문제 상황에 맞는 적절한 지표를 선택하고 임계값을 조절하는 연습을 해보는 것이 좋습니다.
또한 데이터 누수의 위험성을 인지하고, 모델링 과정에서 이를 방지하기 위한 방법을 탐색해 보세요.