robots.txt와 sitemap.xml은 승인 전에도 꼭 손봐야 하는 이유
- 공유 링크 만들기
- X
- 이메일
- 기타 앱
robots와 sitemap은 단순한 SEO 파일이 아니라 어떤 URL을 보여주고 감출지 결정하는 운영 도구다. 설정부터 시작하기 전에 ‘robots.txt는 크롤링 규칙’을 분리해서 봐야 합니다. 검색 로봇이 어떤 경로를 가져갈 수 있는지 안내합니다. URL을 검색 결과에서 반드시 제거하는 장치가 아니며, 내용 확인을 막으면 검색 엔진이 외부 신호만으로 URL을 이해할 수도 있습니다.
이 글의 범위
실제 경험이나 측정 결과를 가정하지 않고, 공식 문서로 확인 가능한 개념과 적용 순서를 일반 가이드로 설명합니다. 제품 버전과 서비스 정책은 바뀔 수 있으므로 적용 전 연결된 공식 문서를 다시 확인하세요.
| robots.txt와 sitemap.xml은 승인 전에도 꼭 손봐야 하는 이유 핵심 판단 흐름 설명용 개념도 |
그림 1. robots.txt와 sitemap.xml은 승인 전에도 꼭 손봐야 하는 이유의 핵심 판단 순서를 정리한 설명용 개념도입니다. 실제 서비스 화면, 운영 로그 또는 측정 결과가 아닙니다.
설정 전에 정리할 문제
robots. ‘robots.txt는 크롤링 규칙’에서 시작해 ‘sitemap.xml은 발견 목록’와의 경계를 정하면 구현할 범위와 실패했을 때 확인할 지점을 구분하기 쉬워집니다.
승인 전 최소 점검
- robots.txt가 200으로 열리고 의도하지 않은 전체 차단이 없는지 확인합니다.
- 사이트맵이 200을 반환하며 파싱 가능한 XML인지 확인합니다.
- 사이트맵 URL이 최종 canonical 호스트와 HTTPS를 사용하는지 확인합니다.
- 라벨·검색·보관함 페이지의 색인 정책을 본문 글과 구분합니다.
- 대표 글 몇 개를 Googlebot과 일반 브라우저 관점에서 열어 상태 코드와 본문 노출을 비교합니다.
기본 상태를 확인하는 요청
curl -I https://example.com/robots.txt
curl -I https://example.com/sitemap.xml
curl -s https://example.com/robots.txt
두 파일의 역할을 정확히 나누기
robots.txt는 크롤링 규칙
검색 로봇이 어떤 경로를 가져갈 수 있는지 안내합니다. URL을 검색 결과에서 반드시 제거하는 장치가 아니며, 내용 확인을 막으면 검색 엔진이 외부 신호만으로 URL을 이해할 수도 있습니다.
sitemap.xml은 발견 목록
검색에 보여 주고 싶은 canonical URL과 갱신 정보를 전달합니다. 사이트맵에 들어갔다고 크롤링이나 색인이 보장되는 것은 아닙니다.
noindex는 색인 제어
공개는 하되 검색 결과에 보여 주지 않을 페이지라면 robots 메타 또는 HTTP 헤더의 noindex가 목적에 맞습니다. noindex를 읽게 하려면 크롤러가 페이지에 접근할 수 있어야 합니다.
Blogger 기본값
Blogger는 기본적으로 사이트맵과 크롤링 설정을 제공합니다. 명확한 문제가 없다면 복잡한 custom robots.txt를 먼저 켜기보다 기본 동작을 확인하는 편이 안전합니다.
광고 크롤러
Mediapartners-Google과 Google-Display-Ads-Bot의 접근을 광범위한 규칙으로 막으면 광고 관련 크롤링 문제가 생길 수 있습니다. 검색 크롤러와 광고 크롤러의 역할을 분리해 봅니다.
작업 전 확인표
| 확인 항목 | 질문 |
|---|---|
| 첫 기준: robots.txt는 크롤링 규칙 | 변경 전에 전제와 목적을 확인했는가? |
| 분리 대상: sitemap.xml은 발견 목록 | 다른 책임과 섞이지 않게 경계를 정했는가? |
| 피할 패턴: noindex 대신 robots.txt 차단만 사용해 색인 제거를 기대하기 | 본문에서 경고한 패턴이 남아 있지 않은가? |
| 오류와 복구 | 정상 경로뿐 아니라 실패와 되돌리기도 확인했는가? |
기술 SEO에서 자주 하는 실수
- noindex 대신 robots.txt 차단만 사용해 색인 제거를 기대하기
- 사이트맵에 리디렉션·404·중복 URL을 모두 넣기
- Blogger 기본 robots.txt를 이해하지 않고 긴 규칙으로 교체하기
- 사이트맵 제출 성공을 승인 또는 검색 노출의 충분조건으로 보기
핵심만 다시 보면
robots.txt는 가져가기, sitemap.xml은 발견하기, noindex는 검색 결과 포함 여부에 관한 도구입니다. 역할을 섞지 않고 Blogger 기본 동작에서 필요한 부분만 조정하면 과도한 설정으로 핵심 글을 막는 실수를 줄일 수 있습니다.
댓글
댓글 쓰기