HTTP
데이터 전처리|조회 4|2026.08.21 22:19
0:00 / 41:50
HTTP
41:50학습 목표
이 강의를 통해 웹 스크래핑의 기본 원리를 이해하고, HTTP 통신 과정을 파악하며, URL 구조와 각 구성 요소의 의미를 학습합니다. 또한, RESTful API 설계 원칙을 이해하고 HTTP 메서드의 올바른 사용법을 익히며, 웹 스크래핑 시 발생할 수 있는 다양한 HTTP 상태 코드와 그 처리 방법을 배우게 됩니다.
핵심 개념
- 웹 스크래핑 (크롤링): 웹 페이지의 데이터를 자동으로 수집하는 기술입니다. 브라우저가 서버에 접속하는 것처럼 코드가 대신 접속하여 원하는 데이터를 가져옵니다.
- HTTP 통신: 웹 브라우저와 서버 간의 데이터 교환에 사용되는 프로토콜입니다. 스크래핑은 기본적으로 HTTP 통신을 기반으로 합니다.
- 정적 크롤링 vs 동적 크롤링: 정적 크롤링은 서버에서 바로 HTML을 가져오는 방식이며, 동적 크롤링은 JavaScript 등을 통해 동적으로 생성되는 콘텐츠를 처리하기 위해 Selenium과 같은 자동화 도구를 사용합니다.
- URL 구조: 스키마(http/https), 호스트(도메인, 서브도메인), 포트, 경로, 쿼리 스트링 등으로 구성됩니다.
- HTTPS: 보안이 강화된 HTTP 통신 방식으로, 데이터 암호화를 통해 안전하게 통신합니다.
- 도메인 & 서브도메인: 웹사이트의 주소를 나타내며, 메인 도메인과 그 앞에 붙는 서브도메인으로 구성됩니다.
- HTTP 요청/응답: 클라이언트(크롤러)가 서버에 요청을 보내고, 서버는 그에 대한 응답을 반환합니다. 이 과정에서 요청 헤더, 바디, 응답 상태 코드 등이 중요하게 작용합니다.
- 요청 헤더: 브라우저 정보(User-Agent), 콘텐츠 타입 등 요청에 대한 부가 정보를 담습니다.
- 상태 코드: 요청 처리 결과를 나타냅니다 (예: 200 OK, 404 Not Found, 500 Internal Server Error).
- RESTful API: URL에는 자원만 명시하고, 행위는 HTTP 메서드(GET, POST, PUT, DELETE 등)를 사용하여 표현하는 설계 방식입니다. 이를 통해 API의 일관성과 예측 가능성을 높입니다.
- 인코딩/디코딩: URL에 한글이나 공백, 특수문자 등이 포함될 경우, 네트워크 통신에서 깨지지 않도록 인코딩 후 전송하고, 서버에서는 이를 디코딩하여 사용합니다.
공부 방향성
이 강의를 통해 웹 스크래핑의 기초와 HTTP 통신에 대한 이해를 높일 수 있습니다. 특히, URL 구조 분석과 RESTful API의 원리를 파악하는 데 집중하세요. 실제 스크래핑 시 발생할 수 있는 다양한 HTTP 상태 코드와 그 의미를 이해하고, 적절한 예외 처리 방법을 학습하는 것이 중요합니다. 이 지식은 향후 웹 스크래핑 라이브러리 활용 및 백엔드 개발 시 API 설계에 큰 도움이 될 것입니다.