Pandans (4)
데이터 전처리|조회 3|2026.08.31 17:47
0:00 / 44:09
Pandans (4)
44:09학습 목표
이 영상을 통해 Pandas 라이브러리를 활용한 데이터 병합(merge) 시 발생할 수 있는 문제점과 이를 해결하는 validate 옵션의 사용법을 익힙니다. 특히, 데이터의 행 수가 예상과 다르게 늘어나는 현상의 원인을 이해하고, validate 옵션을 통해 데이터 무결성을 확보하는 방법을 배웁니다.
핵심 개념
- Pandas Merge: SQL의 JOIN과 유사하게 두 데이터프레임을 특정 키를 기준으로 합치는 기능입니다.
left,right,inner조인 방식을 지원합니다. - 데이터 증폭 문제:
merge시 키 매칭이 제대로 이루어지지 않거나, 키의 관계가 일대다(one-to-many) 또는 다대다(many-to-many)일 경우 의도치 않게 행 수가 늘어나는 현상입니다. 예를 들어, 종가 데이터와 재무 데이터를 '코드'만으로 병합할 때, 재무 데이터의 각 코드가 여러 분기에 걸쳐 존재하면 종가 데이터의 각 행마다 재무 데이터의 모든 분기가 붙어 행 수가 급증합니다. validate옵션:merge함수 내에서 데이터 병합의 유효성을 검증하는 옵션입니다. 다음과 같은 관계를 지정할 수 있습니다.one_to_one('1:1'): 양쪽 데이터프레임의 키가 모두 유일해야 합니다.one_to_many('1:m'): 왼쪽 데이터프레임의 키가 유일해야 합니다. (가장 흔하게 사용됨)many_to_one('m:1'): 오른쪽 데이터프레임의 키가 유일해야 합니다.many_to_many('m:m'): 양쪽 모두 키가 유일하지 않아도 됩니다. (Pandas에서 직접 지원하지 않음, 중계 테이블 필요)
- 키 오류 (KeyError):
validate옵션 설정과 실제 데이터 간의 관계가 일치하지 않을 때 발생하는 에러입니다. 이를 통해 데이터의 중복이나 잘못된 병합을 탐지할 수 있습니다. - 다중 열 키 사용: 단일 열로 고유한 키를 만들 수 없을 때, 여러 열을 조합하여 고유한 키를 생성하는 방법입니다. 예를 들어, '코드'와 '날짜' 또는 '연도'와 '분기'를 함께 사용하여 키를 만듭니다.
공부 방향성
이 영상을 시청하기 전에 Pandas의 기본적인 merge 함수 사용법과 SQL JOIN의 개념을 이해하고 있으면 좋습니다. 영상을 통해 validate 옵션의 중요성을 인지하고, 실제 데이터 분석 시 발생할 수 있는 데이터 증폭 문제를 예방하는 습관을 기르세요. 특히, 데이터의 행 수를 병합 전후로 비교하는 습관을 들이고, validate 옵션을 적극적으로 활용하여 데이터의 무결성을 확보하는 연습을 하시기 바랍니다. 다음 단계로는 시각화 라이브러리를 활용하여 분석 결과를 효과적으로 표현하는 방법을 학습할 수 있습니다.