AI 노출 마케팅이란?
정의·SEO와의 차이·측정 지표.
GPTBot·ClaudeBot·PerplexityBot 같은 AI 크롤러는 목적이 제각각입니다. 어떤 건 AI 답변에 인용되기 위해 와야 하고, 어떤 건 막을지 판단이 필요합니다. 각 봇이 무엇인지, robots.txt로 어떻게 제어하는지 정리했습니다.
목적이 다르면 허용/차단 판단도 달라집니다. 여기부터 나눕니다.
AI 검색·답변 엔진이 인용할 문서를 모으는 크롤링. 여기서 빠지면 AI 답변의 후보에 오르지 못합니다. GEO 관점에서는 오히려 환영해야 하는 접근입니다.
OAI-SearchBot · PerplexityBot · Bingbot
미래 모델을 학습시키기 위해 콘텐츠를 수집하는 크롤링. 노출과의 관계가 간접적이라, 브랜드에 따라 허용/차단 판단이 갈립니다.
GPTBot · ClaudeBot
사용자가 “이 페이지 읽어줘”라고 했을 때 그 순간 가져오는 접근. 실시간 열람이라 대개 막을 이유가 적습니다.
ChatGPT-User · Perplexity-User
각 봇의 정체는 벤더 공식 문서 기준입니다. “제어 토큰”은 크롤러가 아니라 학습 사용만 옵트아웃하는 표식입니다.
| robots.txt 토큰 | 제공사 | 종류 | 설명 |
|---|---|---|---|
| GPTBot | OpenAI | 학습 | OpenAI 모델 학습용 크롤러 |
| OAI-SearchBot | OpenAI | 검색 | ChatGPT 검색 색인 |
| ChatGPT-User | OpenAI | 실시간 | ChatGPT가 사용자 요청으로 페이지 열람 |
| ClaudeBot | Anthropic | 학습 | Anthropic 크롤러 |
| PerplexityBot | Perplexity | 검색 | Perplexity 검색 색인 |
| Perplexity-User | Perplexity | 실시간 | 사용자 요청 실시간 열람 |
| Google-Extended | 제어 토큰 | Gemini/Vertex 학습 사용만 옵트아웃 — Googlebot 검색 크롤링과 별개 | |
| Applebot-Extended | Apple | 제어 토큰 | Apple Intelligence 학습 사용만 옵트아웃 — Applebot 검색과 별개 |
| Bingbot | Microsoft | 검색 | 검색 색인 (Copilot에도 반영) |
| cohere-ai | Cohere | 학습 | Cohere 수집 |
| YouBot | You.com | 검색 | You.com 검색 색인 |
특정 수치를 주장하는 대신, 스스로 로그에서 확인하는 방법입니다.
크롤러 방문은 서버 또는 CDN의 접근 로그에 user-agent로 남습니다. 주의: 일부 호스팅의 기본 로그(예: 일부 서버리스 플랫폼)는 user-agent를 노출하지 않습니다. 이 경우 로그 드레인이나 접근 로그를 제공하는 CDN이 필요합니다.
위 표의 토큰(GPTBot, ClaudeBot, PerplexityBot 등)으로 로그를 필터링해, 어떤 봇이 언제 어떤 경로를 가져갔는지 봅니다.
주요 크롤러는 공식 IP 대역이나 역방향 DNS를 공개합니다. user-agent만 믿지 말고, 필요하면 출처 IP가 공식 대역인지 대조해 위장 트래픽을 걸러냅니다.
중요 페이지가 크롤러 로그에 나타나지 않는다면, robots.txt 차단·색인 누락·구조 문제를 의심합니다. “오긴 오는가”가 GEO의 출발점입니다.
지어낸 수치 대신, 이 사이트가 실제로 쓰는 설정을 그대로 공개합니다.
tableflip.kr의 robots.txt는 위 표의 봇들을 와일드카드(*)와 별개로 이름까지 적어 허용합니다. “읽어도 된다”는 의도를 엔진에 분명히 신호하기 위해서입니다 — 인용되는 것이 목표인 GEO에서는 이 편이 맞습니다.
리드 관리 화면(/leads)과 API(/api/)만 disallow합니다. 공개 콘텐츠는 전부 열어 두고, 노출되면 안 되는 경로만 닫는 것이 기본 원칙입니다.
robots.txt를 AI 용도별 선호로 확장하려는 표준(IETF AIPREF) 논의가 진행 중입니다. 자세한 내용은 관련 리서치에 정리했습니다.
AI 크롤러를 어디까지 받을지에 따라 세 갈래로 갈립니다. 각 선택이 무엇을 얻고 무엇을 잃는지와 함께, 전문을 그대로 적었습니다.
AI 답변에 인용되는 것이 목표라면 이쪽입니다. 공개 콘텐츠는 모두 열고, 노출되면 안 되는 경로만 닫습니다. tableflip.kr이 쓰는 방식입니다.
User-agent: * Allow: / Disallow: /admin/ # 비공개 경로만 닫는다 Disallow: /api/ Sitemap: https://example.com/sitemap.xml
콘텐츠가 모델 학습에 쓰이는 것은 원치 않지만 AI 답변에서는 인용되고 싶을 때. 학습용 봇과 학습 옵트아웃 토큰만 닫고, 검색 색인용은 열어 둡니다.
# 학습용 — 차단 User-agent: GPTBot User-agent: ClaudeBot User-agent: cohere-ai Disallow: / # 학습 사용 옵트아웃 토큰 (검색 크롤링과는 무관) User-agent: Google-Extended User-agent: Applebot-Extended Disallow: / # 검색·실시간 — 허용 (인용 후보로 남기기 위해) User-agent: OAI-SearchBot User-agent: ChatGPT-User User-agent: PerplexityBot User-agent: Perplexity-User User-agent: Bingbot User-agent: YouBot Allow: / User-agent: * Allow: /
AI가 콘텐츠를 일절 가져가지 않기를 원할 때. 검색 색인용까지 막으므로 AI 답변에서 인용될 가능성도 함께 사라집니다. 유료 콘텐츠·회원 전용처럼 노출 자체가 손해인 경우가 아니면 권하지 않습니다.
User-agent: GPTBot User-agent: OAI-SearchBot User-agent: ChatGPT-User User-agent: ClaudeBot User-agent: PerplexityBot User-agent: Perplexity-User User-agent: cohere-ai User-agent: YouBot User-agent: Google-Extended User-agent: Applebot-Extended Disallow: / # Googlebot·Bingbot은 그대로 두어야 일반 검색 노출이 유지됩니다. User-agent: * Allow: /
어느 쪽을 고르든 robots.txt는 강제가 아니라 규약입니다. 반드시 막아야 하는 경로라면 robots.txt에 더해 서버 단 접근 제어로 이중으로 닫으세요. 또한 위 토큰은 각 사업자가 공개한 이름이며, 새 크롤러가 계속 등장하므로 주기적으로 갱신해야 합니다.
robots.txt가 '와서 읽어도 되는지'를 정한다면, llms.txt는 '무엇부터 보면 되는지'를 AI에게 안내합니다.
사이트 루트(/llms.txt)에 두는 마크다운 파일입니다. 크롤러 제어와는 목적이 달라, 작성법·검증·agents.md와의 차이는 전담 글에 따로 정리했습니다.
llms.txt 작성법 자세히 보기