본문으로 건너뛰기
AI Crawlers

AI 크롤러, 오게 할까 막을까

GPTBot·ClaudeBot·PerplexityBot 같은 AI 크롤러는 목적이 제각각입니다. 어떤 건 AI 답변에 인용되기 위해 와야 하고, 어떤 건 막을지 판단이 필요합니다. 각 봇이 무엇인지, robots.txt로 어떻게 제어하는지 정리했습니다.

01Three purposes

크롤러가 콘텐츠를 가져가는 세 가지 이유

목적이 다르면 허용/차단 판단도 달라집니다. 여기부터 나눕니다.

01

검색 색인용

AI 검색·답변 엔진이 인용할 문서를 모으는 크롤링. 여기서 빠지면 AI 답변의 후보에 오르지 못합니다. GEO 관점에서는 오히려 환영해야 하는 접근입니다.

OAI-SearchBot · PerplexityBot · Bingbot

02

모델 학습용

미래 모델을 학습시키기 위해 콘텐츠를 수집하는 크롤링. 노출과의 관계가 간접적이라, 브랜드에 따라 허용/차단 판단이 갈립니다.

GPTBot · ClaudeBot

03

사용자 요청 실시간

사용자가 “이 페이지 읽어줘”라고 했을 때 그 순간 가져오는 접근. 실시간 열람이라 대개 막을 이유가 적습니다.

ChatGPT-User · Perplexity-User

02Reference

주요 AI 크롤러 한눈에

각 봇의 정체는 벤더 공식 문서 기준입니다. “제어 토큰”은 크롤러가 아니라 학습 사용만 옵트아웃하는 표식입니다.

주요 AI 크롤러와 robots.txt 토큰
robots.txt 토큰제공사종류설명
GPTBotOpenAI학습OpenAI 모델 학습용 크롤러
OAI-SearchBotOpenAI검색ChatGPT 검색 색인
ChatGPT-UserOpenAI실시간ChatGPT가 사용자 요청으로 페이지 열람
ClaudeBotAnthropic학습Anthropic 크롤러
PerplexityBotPerplexity검색Perplexity 검색 색인
Perplexity-UserPerplexity실시간사용자 요청 실시간 열람
Google-ExtendedGoogle제어 토큰Gemini/Vertex 학습 사용만 옵트아웃 — Googlebot 검색 크롤링과 별개
Applebot-ExtendedApple제어 토큰Apple Intelligence 학습 사용만 옵트아웃 — Applebot 검색과 별개
BingbotMicrosoft검색검색 색인 (Copilot에도 반영)
cohere-aiCohere학습Cohere 수집
YouBotYou.com검색You.com 검색 색인
03Check yours

내 사이트에 오고 있는지 확인하는 법

특정 수치를 주장하는 대신, 스스로 로그에서 확인하는 방법입니다.

  1. 01

    서버·CDN 접근 로그를 연다

    크롤러 방문은 서버 또는 CDN의 접근 로그에 user-agent로 남습니다. 주의: 일부 호스팅의 기본 로그(예: 일부 서버리스 플랫폼)는 user-agent를 노출하지 않습니다. 이 경우 로그 드레인이나 접근 로그를 제공하는 CDN이 필요합니다.

  2. 02

    user-agent로 봇을 걸러낸다

    위 표의 토큰(GPTBot, ClaudeBot, PerplexityBot 등)으로 로그를 필터링해, 어떤 봇이 언제 어떤 경로를 가져갔는지 봅니다.

  3. 03

    위장 여부를 확인한다

    주요 크롤러는 공식 IP 대역이나 역방향 DNS를 공개합니다. user-agent만 믿지 말고, 필요하면 출처 IP가 공식 대역인지 대조해 위장 트래픽을 걸러냅니다.

  4. 04

    핵심 페이지가 실제로 수집되는지 본다

    중요 페이지가 크롤러 로그에 나타나지 않는다면, robots.txt 차단·색인 누락·구조 문제를 의심합니다. “오긴 오는가”가 GEO의 출발점입니다.

04Worked example

TableFlip의 실제 정책

지어낸 수치 대신, 이 사이트가 실제로 쓰는 설정을 그대로 공개합니다.

AI 크롤러 13종을 명시적으로 허용

tableflip.kr의 robots.txt는 위 표의 봇들을 와일드카드(*)와 별개로 이름까지 적어 허용합니다. “읽어도 된다”는 의도를 엔진에 분명히 신호하기 위해서입니다 — 인용되는 것이 목표인 GEO에서는 이 편이 맞습니다.

비공개 경로만 차단

리드 관리 화면(/leads)과 API(/api/)만 disallow합니다. 공개 콘텐츠는 전부 열어 두고, 노출되면 안 되는 경로만 닫는 것이 기본 원칙입니다.

robots.txt를 AI 용도별 선호로 확장하려는 표준(IETF AIPREF) 논의가 진행 중입니다. 자세한 내용은 관련 리서치에 정리했습니다.

05robots.txt

robots.txt, 그대로 복사해 쓰는 3가지 설정

AI 크롤러를 어디까지 받을지에 따라 세 갈래로 갈립니다. 각 선택이 무엇을 얻고 무엇을 잃는지와 함께, 전문을 그대로 적었습니다.

01

전면 허용

GEO 권장

AI 답변에 인용되는 것이 목표라면 이쪽입니다. 공개 콘텐츠는 모두 열고, 노출되면 안 되는 경로만 닫습니다. tableflip.kr이 쓰는 방식입니다.

User-agent: *
Allow: /
Disallow: /admin/       # 비공개 경로만 닫는다
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
02

학습만 차단, 검색·실시간은 허용

절충

콘텐츠가 모델 학습에 쓰이는 것은 원치 않지만 AI 답변에서는 인용되고 싶을 때. 학습용 봇과 학습 옵트아웃 토큰만 닫고, 검색 색인용은 열어 둡니다.

# 학습용 — 차단
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: cohere-ai
Disallow: /

# 학습 사용 옵트아웃 토큰 (검색 크롤링과는 무관)
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

# 검색·실시간 — 허용 (인용 후보로 남기기 위해)
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Bingbot
User-agent: YouBot
Allow: /

User-agent: *
Allow: /
03

전면 차단

노출 포기

AI가 콘텐츠를 일절 가져가지 않기를 원할 때. 검색 색인용까지 막으므로 AI 답변에서 인용될 가능성도 함께 사라집니다. 유료 콘텐츠·회원 전용처럼 노출 자체가 손해인 경우가 아니면 권하지 않습니다.

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: cohere-ai
User-agent: YouBot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

# Googlebot·Bingbot은 그대로 두어야 일반 검색 노출이 유지됩니다.
User-agent: *
Allow: /

어느 쪽을 고르든 robots.txt는 강제가 아니라 규약입니다. 반드시 막아야 하는 경로라면 robots.txt에 더해 서버 단 접근 제어로 이중으로 닫으세요. 또한 위 토큰은 각 사업자가 공개한 이름이며, 새 크롤러가 계속 등장하므로 주기적으로 갱신해야 합니다.

06llms.txt

robots.txt 다음은 llms.txt

robots.txt가 '와서 읽어도 되는지'를 정한다면, llms.txt는 '무엇부터 보면 되는지'를 AI에게 안내합니다.

사이트 루트(/llms.txt)에 두는 마크다운 파일입니다. 크롤러 제어와는 목적이 달라, 작성법·검증·agents.md와의 차이는 전담 글에 따로 정리했습니다.

llms.txt 작성법 자세히 보기
07FAQ

자주 묻는 질문

01

AI 크롤러를 막으면 AI 노출에 손해인가요?

종류에 따라 다릅니다. 검색 색인용 크롤러(OAI-SearchBot·PerplexityBot 등)를 막으면 그 엔진의 AI 답변에서 인용될 후보에서 빠질 수 있어, GEO 관점에서는 손해입니다. 반면 학습용 크롤러(GPTBot 등) 차단은 당장의 검색 노출과는 관계가 상대적으로 적어, 학습 사용에 대한 정책 판단의 영역입니다.
02

Google-Extended를 막으면 구글 검색에서 사라지나요?

아닙니다. Google-Extended는 별도의 크롤러가 아니라, 이미 수집된 콘텐츠를 Gemini 등 구글 AI 제품의 학습에 쓰는 것만 옵트아웃하는 제어 토큰입니다. 일반 검색 크롤링은 Googlebot이 담당하므로, Google-Extended를 disallow해도 구글 검색 노출에는 영향이 없습니다. Applebot-Extended도 같은 구조입니다.
03

robots.txt로 막으면 확실히 안 오나요?

robots.txt는 강제가 아니라 규약입니다. 주요 사업자의 공식 크롤러는 대체로 이를 준수한다고 밝히고 있지만, 준수를 보장하는 기술적 장치는 아닙니다. 반드시 차단해야 하는 경로는 robots.txt에 더해 서버 단의 접근 제어(인증·차단)로 이중으로 막는 것이 안전합니다.
04

앞으로 이 방식이 바뀌나요?

robots.txt를 AI 용도(학습·검색·실시간)별 선호로 확장하려는 표준화 논의(IETF AIPREF)가 진행 중입니다. 지금은 봇 이름별로 허용/차단을 나누지만, 앞으로는 “용도별로” 더 세밀하게 지정하는 방향으로 갈 가능성이 있습니다.
관련 문서

함께 읽으면 좋은 글