Pandas (1)
데이터 전처리|조회 2|2026.08.26 17:07
0:00 / 44:12
Pandas (1)
44:12학습 목표
이 강의를 통해 Pandas 라이브러리의 기본 데이터 구조인 Series와 DataFrame을 이해하고, 실제 데이터를 로드하고 전처리하는 방법을 배웁니다. 결측치 및 이상치 처리, 데이터 정렬 등 데이터 분석의 기초가 되는 Pandas 활용 능력을 기릅니다.
핵심 개념
- Series: 인덱스가 부여된 1차원 배열 형태의 Pandas 자료구조.
- DataFrame: 여러 개의 Series가 모여 만들어진 2차원 테이블 형태의 Pandas 자료구조.
- 데이터 로딩:
pd.read_csv()함수를 사용하여 CSV 파일을 DataFrame으로 불러오는 방법.encoding='utf-8-sig': UTF-8 인코딩 파일 처리.na_values: 특정 문자열을 결측치(NaN)로 처리.thousands=',': 천 단위 구분 기호(콤마)를 제거하고 숫자로 변환.
- 결측치(Missing Value): 데이터에 값이 없는 경우를 의미하며,
NaN으로 표현됩니다. Pandas는 결측치 처리를 위한 다양한 기능을 제공합니다. - 이상치(Outlier): 전체 데이터의 분포에서 벗어난 값으로, 통계적 기법을 통해 탐지하고 처리할 수 있습니다.
- 데이터 정렬:
sort_values()함수를 사용하여 특정 컬럼 기준으로 데이터를 정렬하고,reset_index()로 인덱스를 재설정하는 방법. - 날짜/시간 데이터 처리:
pd.to_datetime()함수를 사용하여 문자열 형태의 날짜 데이터를 datetime 객체로 변환.
공부 방향성
Pandas를 처음 접하는 학습자를 대상으로 하며, 데이터 분석의 첫걸음으로 Pandas의 기본기를 다지는 데 집중합니다. 강의에서 다룬 데이터 로딩 및 전처리 과정을 직접 실습하며 익히고, 이후에는 Pandas의 다양한 함수와 고급 기능을 학습하여 실제 데이터 분석 프로젝트에 적용하는 것을 목표로 합니다.