Robots.txt 생성기
robots.txt 파일을 즉시 생성하세요. User-agent 규칙, Allow/Disallow 경로, Sitemap URL을 설정할 수 있습니다. 회원가입 없이 무료로 사용 가능합니다.
- 브라우저에서 처리
- 데이터가 브라우저 밖으로 나가지 않습니다
- 무료 · 회원가입 불필요
WeChat으로 스캔하여 공유
예시·자세한 설명·자주 묻는 질문 실제 출력이 있는 예시, 다른 도구와의 차이, 자주 묻는 질문.
예: 카페24 FAQ의 폴더 경로를 URL 경로로 바꾸기
카페24 웹호스팅 FAQ「일일 전송량(트래픽)이 초과되었다고 나옵니다」에는 특정 봇의 접근을 robots.txt로 막는 예시가 있습니다. 그중 “구글봇만 www/hompage 디렉토리 접근 차단” 예시를 생성기에 그대로 입력하면 다음과 같이 출력됩니다. 생성기는 경로를 검사하지 않습니다.
User-agent: Googlebot
Disallow: www/hompage
www는 FTP에서 보이는 폴더 이름입니다. 카페24 웹호스팅은 메인 페이지 경로를 /www/index.html로 안내하므로(홈페이지 접속 오류 FAQ), www/hompage 폴더는 웹에서 /hompage/로 열립니다. 또 RFC 9309의 문법에서 경로는 반드시 /로 시작하므로, www/hompage는 규칙으로 읽힌다는 보장이 없습니다. URL 경로로 고쳐 쓰면 다음과 같습니다.
User-agent: Googlebot
Disallow: /hompage/
RFC 9309의 규칙으로 읽으면 Googlebot은 /hompage/index.html을 수집할 수 없고 첫 페이지 /는 수집할 수 있습니다. 파일에 * 그룹이 없으니 네이버의 Yeti를 비롯한 다른 봇에는 아무 제한도 걸리지 않습니다.
예: 구글은 허용하고 네이버는 차단하기
같은 FAQ의 “구글은 허용, 네이버는 차단” 예시는 Googlebot 블록에 빈 Disallow:, Yeti 블록에 Disallow:/를 씁니다. 네이버 서치어드바이저의 robots.txt 설정하기도 네이버 검색로봇(Yeti)이 robots.txt에 작성된 규칙을 준수한다고 밝히고 있습니다. 생성기에서는 규칙 없는 Googlebot 블록과, “직접 입력…”으로 Yeti를 넣고 /를 차단한 블록을 만듭니다.
User-agent: Googlebot
Disallow:
User-agent: Yeti
Disallow: /
FAQ 예시와 달리 콜론 뒤에 공백이 하나 들어가지만, RFC 9309는 콜론 앞뒤의 공백을 허용하므로 뜻은 같습니다. Yeti는 모든 경로가 차단되고 Googlebot은 모두 허용됩니다. 이 파일에도 * 그룹이 없어서 Bingbot 같은 다른 봇은 제한 없이 수집합니다. 같은 FAQ도 검색 로봇을 차단하면 포털 검색 노출이 제한될 수 있다고 안내합니다.
자주 쓰는 robots.txt 패턴
- 모든 봇 차단:
User-agent: *+Disallow: / - 모든 봇 허용:
User-agent: *+Disallow:(값 비워 두기). 규칙이 하나도 없는 블록은 이 빈Disallow:를 출력합니다. - 특정 디렉터리 차단:
Disallow: /admin/ - 봇 하나만 허용:
*블록에서/를 차단하고, 허용할 봇의 블록은 규칙 없이 추가하기
생성기의 제한과 robots.txt의 한계
- 검증하지 않음: 경로는 앞뒤 공백만 지우고 그대로 씁니다.
admin/처럼/로 시작하지 않는 값은 RFC 9309의 올바른 규칙이 아닙니다. 빈 경로는 빈 규칙이 됩니다. - Sitemap은 한 줄: 사이트맵이 여러 개라면 줄을 복사해 직접 추가하세요.
Crawl-delay같은 비표준 줄은 만들지 않습니다. - 와일드카드:
*와$는 RFC 9309에 포함되어Disallow: /*?sessionid=처럼 경로에 쓸 수 있습니다. 생성기는 와일드카드 문법을 검사하지 않습니다. - 차단은 삭제가 아님: 차단한 URL도 다른 페이지가 링크하면 설명 없이 검색 결과에 나올 수 있습니다. 결과에서 빼려면 수집을 허용하고 메타 태그 생성기로 만든
noindex를 보내세요. - 크기와 오류: RFC 9309는 크롤러가 적어도 앞 500 KiB를 해석하도록 요구합니다. robots.txt가 4xx를 돌려주면 크롤러는 모든 것을 수집해도 되고, 5xx를 돌려주거나 연결할 수 없으면 전부 차단된 것으로 봅니다.
- 호스트마다 한 파일: 파일은
https://내 도메인/robots.txt로 열리는 곳에 둡니다.example.co.kr의 규칙은m.example.co.kr에 적용되지 않으므로 서브도메인마다 따로 두세요.
FAQ
robots.txt란 무엇인가요?
웹사이트 루트(예: https://example.com/robots.txt)에 두는 텍스트 파일로, 크롤러에게 어떤 페이지나 디렉터리를 수집해도 되고 어떤 곳은 안 되는지 알려 줍니다. Robots Exclusion Protocol을 따르며, 이 규약은 RFC 9309로 표준화되었습니다.
robots.txt로 모든 봇을 차단할 수 있나요?
아닙니다. robots.txt는 규약일 뿐 보안 수단이 아닙니다. Googlebot이나 네이버의 Yeti처럼 규칙을 지키는 크롤러는 따르지만, 악성 봇은 무시할 수 있습니다. 접근을 실제로 막으려면 서버에서 접근 제어를 하세요.
'Disallow: /'는 무슨 뜻인가요?
지정한 User-agent에게 사이트의 어떤 페이지도 수집하지 말라고 알립니다. 'User-agent: *'와 함께 쓰면 규칙을 따르는 모든 봇이 사이트 전체를 수집하지 않습니다. 도구를 열었을 때의 초기 상태이기도 하니, 게시하기 전에 바꾸세요.
여러 User-agent 블록을 설정할 수 있나요?
네. “+ User-agent 블록 추가”로 늘릴 수 있습니다. 크롤러는 자기 이름과 맞는 그룹 하나만 따르므로, Yeti 블록을 만들면 Yeti는 * 블록을 읽지 않습니다. 공통 규칙은 두 블록에 모두 적어야 합니다.
Sitemap 줄은 어디에 넣어야 하나요?
파일 어디에 넣어도 됩니다. Sitemap 줄은 어떤 User-agent 그룹에도 속하지 않아 위치에 따른 차이가 없고, 도구는 맨 끝에 씁니다. 크롤러에게 XML 사이트맵의 위치를 알려 수집할 페이지를 찾기 쉽게 합니다.
입력한 경로와 URL이 어딘가로 전송되거나 저장되나요?
아닙니다. 파일은 브라우저 페이지 안에서 만들어집니다. 도구는 입력한 Sitemap URL에 접속하지 않고, 경로나 봇 이름을 서버로 보내거나 브라우저 저장소에 남기지도 않으므로 새로 고치면 초기 블록으로 돌아갑니다. 변경을 확정할 때(값을 바꾸고 입력란에서 벗어나기, 봇 선택, 규칙이나 블록 추가·삭제) 사이트 통계가 도구 이름과 동작을 한 번 기록하지만, 입력한 내용은 기록하지 않습니다.