데이터 저장
데이터 전처리|조회 6|2026.08.21 22:30
0:00 / 29:00
데이터 저장
29:00학습 목표
이 영상을 통해 웹 스크래핑의 기본 원리를 이해하고, 파이썬을 사용하여 웹 페이지에서 데이터를 추출하여 CSV 및 JSON 파일로 저장하는 방법을 배웁니다. 특히, HTML 파싱 라이브러리를 활용하여 동적/정적 웹 페이지에서 데이터를 효과적으로 추출하고 저장하는 기술을 익힙니다.
핵심 개념
- 웹 스크래핑: 웹사이트에서 데이터를 자동으로 수집하는 기술입니다.
- HTML 파싱: HTML 문서를 분석하여 원하는 데이터를 추출하는 과정입니다.
BeautifulSoup과 같은 라이브러리가 사용됩니다. - 데이터 추출 함수: 반복적인 데이터 추출 작업을 함수로 만들어 코드의 재사용성과 가독성을 높입니다.
def parse_stock_row(row):
# row에서 코드, 이름, 가격 등 추출 로직
return extracted_data
- URL 조인: 기본 URL과 상대 경로를 올바르게 결합하여 완전한 URL을 생성합니다.
urllib.parse.urljoin함수를 활용합니다. - CSV 저장: 데이터를 쉼표로 구분된 값(Comma-Separated Values) 형식의 파일로 저장합니다.
csv모듈의DictWriter를 사용하여 딕셔너리 형태의 데이터를 쉽게 저장할 수 있습니다. - JSON 저장: 데이터를 JavaScript Object Notation 형식의 파일로 저장합니다.
json모듈의dump함수를 사용하여 파이썬 객체를 JSON 파일로 직렬화합니다.
공부 방향성
이 영상을 시청하기 전에 HTML 구조와 기본적인 파이썬 문법에 대한 이해가 있다면 학습에 더 도움이 될 것입니다. 영상 시청 후에는 실제 웹사이트에서 데이터를 추출하고 저장하는 연습을 해보며, 다양한 웹사이트의 구조에 맞춰 파싱 로직을 수정하는 경험을 쌓는 것이 좋습니다. 또한, 동적 웹 페이지 처리를 위한 Selenium과 같은 추가적인 라이브러리 학습으로 확장할 수 있습니다.