AI 노출 마케팅이란?
정의·SEO와의 차이·측정 지표.
GPTBot·ClaudeBot·PerplexityBot 같은 AI 크롤러는 목적이 제각각입니다. 어떤 건 AI 답변에 인용되기 위해 와야 하고, 어떤 건 막을지 판단이 필요합니다. 각 봇이 무엇인지, robots.txt로 어떻게 제어하는지 정리했습니다.
목적이 다르면 허용/차단 판단도 달라집니다. 여기부터 나눕니다.
AI 검색·답변 엔진이 인용할 문서를 모으는 크롤링. 여기서 빠지면 AI 답변의 후보에 오르지 못합니다. GEO 관점에서는 오히려 환영해야 하는 접근입니다.
OAI-SearchBot · PerplexityBot · Bingbot
미래 모델을 학습시키기 위해 콘텐츠를 수집하는 크롤링. 노출과의 관계가 간접적이라, 브랜드에 따라 허용/차단 판단이 갈립니다.
GPTBot · ClaudeBot
사용자가 “이 페이지 읽어줘”라고 했을 때 그 순간 가져오는 접근. 실시간 열람이라 대개 막을 이유가 적습니다.
ChatGPT-User · Perplexity-User
각 봇의 정체는 벤더 공식 문서 기준입니다. “제어 토큰”은 크롤러가 아니라 학습 사용만 옵트아웃하는 표식입니다.
| robots.txt 토큰 | 제공사 | 종류 | 설명 |
|---|---|---|---|
| GPTBot | OpenAI | 학습 | OpenAI 모델 학습용 크롤러 |
| OAI-SearchBot | OpenAI | 검색 | ChatGPT 검색 색인 |
| ChatGPT-User | OpenAI | 실시간 | ChatGPT가 사용자 요청으로 페이지 열람 |
| ClaudeBot | Anthropic | 학습 | Anthropic 크롤러 |
| PerplexityBot | Perplexity | 검색 | Perplexity 검색 색인 |
| Perplexity-User | Perplexity | 실시간 | 사용자 요청 실시간 열람 |
| Google-Extended | 제어 토큰 | Gemini/Vertex 학습 사용만 옵트아웃 — Googlebot 검색 크롤링과 별개 | |
| Applebot-Extended | Apple | 제어 토큰 | Apple Intelligence 학습 사용만 옵트아웃 — Applebot 검색과 별개 |
| Bingbot | Microsoft | 검색 | 검색 색인 (Copilot에도 반영) |
| cohere-ai | Cohere | 학습 | Cohere 수집 |
| YouBot | You.com | 검색 | You.com 검색 색인 |
특정 수치를 주장하는 대신, 스스로 로그에서 확인하는 방법입니다.
크롤러 방문은 서버 또는 CDN의 접근 로그에 user-agent로 남습니다. 주의: 일부 호스팅의 기본 로그(예: 일부 서버리스 플랫폼)는 user-agent를 노출하지 않습니다. 이 경우 로그 드레인이나 접근 로그를 제공하는 CDN이 필요합니다.
위 표의 토큰(GPTBot, ClaudeBot, PerplexityBot 등)으로 로그를 필터링해, 어떤 봇이 언제 어떤 경로를 가져갔는지 봅니다.
주요 크롤러는 공식 IP 대역이나 역방향 DNS를 공개합니다. user-agent만 믿지 말고, 필요하면 출처 IP가 공식 대역인지 대조해 위장 트래픽을 걸러냅니다.
중요 페이지가 크롤러 로그에 나타나지 않는다면, robots.txt 차단·색인 누락·구조 문제를 의심합니다. “오긴 오는가”가 GEO의 출발점입니다.
지어낸 수치 대신, 이 사이트가 실제로 쓰는 설정을 그대로 공개합니다.
tableflip.kr의 robots.txt는 위 표의 봇들을 와일드카드(*)와 별개로 이름까지 적어 허용합니다. “읽어도 된다”는 의도를 엔진에 분명히 신호하기 위해서입니다 — 인용되는 것이 목표인 GEO에서는 이 편이 맞습니다.
리드 관리 화면(/leads)과 API(/api/)만 disallow합니다. 공개 콘텐츠는 전부 열어 두고, 노출되면 안 되는 경로만 닫는 것이 기본 원칙입니다.
robots.txt를 AI 용도별 선호로 확장하려는 표준(IETF AIPREF) 논의가 진행 중입니다. 자세한 내용은 관련 리서치에 정리했습니다.