본문으로 건너뛰기
AI Crawlers

AI 크롤러, 오게 할까 막을까

GPTBot·ClaudeBot·PerplexityBot 같은 AI 크롤러는 목적이 제각각입니다. 어떤 건 AI 답변에 인용되기 위해 와야 하고, 어떤 건 막을지 판단이 필요합니다. 각 봇이 무엇인지, robots.txt로 어떻게 제어하는지 정리했습니다.

01Three purposes

크롤러가 콘텐츠를 가져가는 세 가지 이유

목적이 다르면 허용/차단 판단도 달라집니다. 여기부터 나눕니다.

01

검색 색인용

AI 검색·답변 엔진이 인용할 문서를 모으는 크롤링. 여기서 빠지면 AI 답변의 후보에 오르지 못합니다. GEO 관점에서는 오히려 환영해야 하는 접근입니다.

OAI-SearchBot · PerplexityBot · Bingbot

02

모델 학습용

미래 모델을 학습시키기 위해 콘텐츠를 수집하는 크롤링. 노출과의 관계가 간접적이라, 브랜드에 따라 허용/차단 판단이 갈립니다.

GPTBot · ClaudeBot

03

사용자 요청 실시간

사용자가 “이 페이지 읽어줘”라고 했을 때 그 순간 가져오는 접근. 실시간 열람이라 대개 막을 이유가 적습니다.

ChatGPT-User · Perplexity-User

02Reference

주요 AI 크롤러 한눈에

각 봇의 정체는 벤더 공식 문서 기준입니다. “제어 토큰”은 크롤러가 아니라 학습 사용만 옵트아웃하는 표식입니다.

주요 AI 크롤러와 robots.txt 토큰
robots.txt 토큰제공사종류설명
GPTBotOpenAI학습OpenAI 모델 학습용 크롤러
OAI-SearchBotOpenAI검색ChatGPT 검색 색인
ChatGPT-UserOpenAI실시간ChatGPT가 사용자 요청으로 페이지 열람
ClaudeBotAnthropic학습Anthropic 크롤러
PerplexityBotPerplexity검색Perplexity 검색 색인
Perplexity-UserPerplexity실시간사용자 요청 실시간 열람
Google-ExtendedGoogle제어 토큰Gemini/Vertex 학습 사용만 옵트아웃 — Googlebot 검색 크롤링과 별개
Applebot-ExtendedApple제어 토큰Apple Intelligence 학습 사용만 옵트아웃 — Applebot 검색과 별개
BingbotMicrosoft검색검색 색인 (Copilot에도 반영)
cohere-aiCohere학습Cohere 수집
YouBotYou.com검색You.com 검색 색인
03Check yours

내 사이트에 오고 있는지 확인하는 법

특정 수치를 주장하는 대신, 스스로 로그에서 확인하는 방법입니다.

  1. 01

    서버·CDN 접근 로그를 연다

    크롤러 방문은 서버 또는 CDN의 접근 로그에 user-agent로 남습니다. 주의: 일부 호스팅의 기본 로그(예: 일부 서버리스 플랫폼)는 user-agent를 노출하지 않습니다. 이 경우 로그 드레인이나 접근 로그를 제공하는 CDN이 필요합니다.

  2. 02

    user-agent로 봇을 걸러낸다

    위 표의 토큰(GPTBot, ClaudeBot, PerplexityBot 등)으로 로그를 필터링해, 어떤 봇이 언제 어떤 경로를 가져갔는지 봅니다.

  3. 03

    위장 여부를 확인한다

    주요 크롤러는 공식 IP 대역이나 역방향 DNS를 공개합니다. user-agent만 믿지 말고, 필요하면 출처 IP가 공식 대역인지 대조해 위장 트래픽을 걸러냅니다.

  4. 04

    핵심 페이지가 실제로 수집되는지 본다

    중요 페이지가 크롤러 로그에 나타나지 않는다면, robots.txt 차단·색인 누락·구조 문제를 의심합니다. “오긴 오는가”가 GEO의 출발점입니다.

04Worked example

TableFlip의 실제 정책

지어낸 수치 대신, 이 사이트가 실제로 쓰는 설정을 그대로 공개합니다.

AI 크롤러 13종을 명시적으로 허용

tableflip.kr의 robots.txt는 위 표의 봇들을 와일드카드(*)와 별개로 이름까지 적어 허용합니다. “읽어도 된다”는 의도를 엔진에 분명히 신호하기 위해서입니다 — 인용되는 것이 목표인 GEO에서는 이 편이 맞습니다.

비공개 경로만 차단

리드 관리 화면(/leads)과 API(/api/)만 disallow합니다. 공개 콘텐츠는 전부 열어 두고, 노출되면 안 되는 경로만 닫는 것이 기본 원칙입니다.

robots.txt를 AI 용도별 선호로 확장하려는 표준(IETF AIPREF) 논의가 진행 중입니다. 자세한 내용은 관련 리서치에 정리했습니다.

05FAQ

자주 묻는 질문

01

AI 크롤러를 막으면 AI 노출에 손해인가요?

종류에 따라 다릅니다. 검색 색인용 크롤러(OAI-SearchBot·PerplexityBot 등)를 막으면 그 엔진의 AI 답변에서 인용될 후보에서 빠질 수 있어, GEO 관점에서는 손해입니다. 반면 학습용 크롤러(GPTBot 등) 차단은 당장의 검색 노출과는 관계가 상대적으로 적어, 학습 사용에 대한 정책 판단의 영역입니다.
02

Google-Extended를 막으면 구글 검색에서 사라지나요?

아닙니다. Google-Extended는 별도의 크롤러가 아니라, 이미 수집된 콘텐츠를 Gemini 등 구글 AI 제품의 학습에 쓰는 것만 옵트아웃하는 제어 토큰입니다. 일반 검색 크롤링은 Googlebot이 담당하므로, Google-Extended를 disallow해도 구글 검색 노출에는 영향이 없습니다. Applebot-Extended도 같은 구조입니다.
03

robots.txt로 막으면 확실히 안 오나요?

robots.txt는 강제가 아니라 규약입니다. 주요 사업자의 공식 크롤러는 대체로 이를 준수한다고 밝히고 있지만, 준수를 보장하는 기술적 장치는 아닙니다. 반드시 차단해야 하는 경로는 robots.txt에 더해 서버 단의 접근 제어(인증·차단)로 이중으로 막는 것이 안전합니다.
04

앞으로 이 방식이 바뀌나요?

robots.txt를 AI 용도(학습·검색·실시간)별 선호로 확장하려는 표준화 논의(IETF AIPREF)가 진행 중입니다. 지금은 봇 이름별로 허용/차단을 나누지만, 앞으로는 “용도별로” 더 세밀하게 지정하는 방향으로 갈 가능성이 있습니다.
관련 문서

함께 읽으면 좋은 글