BeautifulSoup
데이터 전처리|조회 5|2026.08.21 22:22
0:00 / 43:02
BeautifulSoup
43:02학습 목표
이 영상을 통해 웹 스크래핑의 핵심 라이브러리인 BeautifulSoup의 기본 사용법을 익히고, 실제 웹 페이지에서 데이터를 추출하는 과정을 이해할 수 있습니다. 특히, requests 라이브러리를 활용하여 웹 페이지의 HTML을 가져오고, BeautifulSoup을 이용해 원하는 데이터를 파싱하는 방법을 배웁니다.
핵심 개념
- 웹 스크래핑 (Web Scraping): 웹사이트에서 데이터를 자동으로 추출하는 기술입니다.
- BeautifulSoup: HTML 및 XML 문서에서 데이터를 쉽게 추출하도록 돕는 파이썬 라이브러리입니다. DOM(Document Object Model) 트리 구조를 다룰 수 있게 해줍니다.
- Requests: HTTP 요청을 보내고 응답을 받는 데 사용되는 파이썬 라이브러리입니다. 웹 페이지의 HTML 소스를 가져오는 데 활용됩니다.
requirements.txt: 프로젝트에서 사용하는 파이썬 패키지 목록과 버전을 명시하는 파일입니다.pip freeze명령어를 통해 생성하고,pip install -r requirements.txt로 설치할 수 있습니다.- 가상 환경 (Virtual Environment): 프로젝트별로 독립적인 파이썬 패키지 환경을 구성하여 의존성 충돌을 방지합니다.
config.py: 환경 변수나 공통 설정 값을 저장하는 파일로, 코드와 설정을 분리하고 Git에 민감한 정보를 올리지 않도록 합니다.- CSS 선택자 (CSS Selectors): HTML 요소를 선택하는 데 사용되는 문법으로, BeautifulSoup의
select()및select_one()메서드에서 활용됩니다. select()vsselect_one():select()는 조건에 맞는 모든 요소를 리스트로 반환하고,select_one()은 첫 번째 일치하는 요소만 반환합니다..textvs.get_text(): 태그 내의 텍스트 콘텐츠를 추출하는 메서드입니다..get_text(strip=True)는 앞뒤 공백을 제거한 텍스트를 반환하여 유용합니다.- 속성 추출 (
.get()): 태그의 속성 값(예:href,src)을 가져올 때 사용합니다. 값이 없을 경우 에러 대신 기본값을 지정할 수 있어 안전합니다.
공부 방향성
이 영상은 웹 스크래핑의 기초를 다루므로, 시청 후에는 다양한 웹사이트에 BeautifulSoup을 적용해보며 연습하는 것이 중요합니다. 특히, 동적인 웹 페이지(JavaScript로 렌더링되는 페이지)는 requests와 BeautifulSoup만으로는 한계가 있을 수 있으므로, Selenium과 같은 브라우저 자동화 도구를 추가로 학습하는 것을 추천합니다. 또한, 웹 스크래핑 시에는 반드시 해당 웹사이트의 robots.txt 파일을 확인하고, 서버에 과도한 부하를 주지 않도록 주의해야 합니다.