Claude Fable 5.1 출시: '장시간 리서치'가 프런티어 기준이 되다
핵심 요약
- Anthropic은 2026년 9월 1일 Claude Fable 5.1과 트러스티드 액세스 쌍둥이 Mythos 5.1을 하나의 기반 모델로 출시했다(Anthropic 발표).
- 에이전틱 과학 연구 벤치마크 Terminal-Bench-Science 0.1에서 Fable 5.1은 52.6%를 기록해 Opus 5(29.0%), Fable 5(24.7%), GPT-5.6 Sol(22.4%)을 앞섰다(Anthropic 자체 보고, 표준오차 3.5~4.5점).
- 캐시 리드 가격을 100만 토큰당 $1.00에서 $0.25로 75% 인하했으며, Anthropic은 이를 일반 워크로드 약 25%, 에이전틱 워크로드 최대 45% 비용 절감으로 측정한다(MarkTechPost).
- Fable 5.1은 100만 토큰 컨텍스트 윈도우를 가지며 단일 응답에서 최대 128,000 토큰까지 생성한다(AI Discoveries).
- Artificial Analysis Intelligence Index 65.7로 리더보드 1위이며 Claude Opus 5(63.1), Fable 5(62.1)를 앞선다(ModelGrep).
Fable 5.1의 진짜 변화는 무엇인가?
결론부터 말하면, 이번 릴리스의 핵심은 단일 벤치마크 점수가 아니라 가격 구조와 능력의 방향이 모두 '장시간 자율 에이전트 리서치'로 이동했다는 점이다. Anthropic 발표에 따르면 Fable 5.1과 Mythos 5.1은 9월 1일 하나의 기반 모델로 출시됐으며, Fable은 널리 이용 가능하고 Mythos는 Project Glasswing 하의 검증된 사이버보안·생명과학 프로그램에만 제한된다.
Coursiv에 따르면 가장 큰 개선은 장시간 에이전틱 작업에 집중돼 있다. 단기 벤치마크는 몇 점만 움직인 반면, 장시간 작업 지표는 크게 올랐다.
| 벤치마크 | Fable 5.1 | 비교 |
|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | Fable 5는 24.7% |
| Terminal-Bench 4.0 | 55.8% | — |
| AutomationBench | 31.4% | — |
| Intelligence Index | 65.7 | Opus 5 63.1 |
가격 구조는 왜 중요한가?
핵심 상업 지표는 캐시 리드 75% 인하다. MarkTechPost에 따르면 기본 입력·출력 가격은 100만 토큰당 $10·$50로 변동이 없지만, 캐시 리드는 $1.00에서 $0.25로 내려갔다. DataCamp는 정가를 유지하면서 캐시 리드만 75% 인하한 것이 어떤 단일 벤치마크 행보보다 흥미로운 움직임이라 평했다.
이는 Anthropic이 프런티어가 채팅 턴이 아니라 무인 가동 시간(unattended hours)으로 측정되는 데 베팅하고 있으며, 그 베팅이 저렴해지도록 가격을 책정했음을 보여준다.
검색·브라우징 능력은 브랜드 노출에 어떤 영향을 주나?
답은 노출 접점이 '한 번의 인용'에서 '리서치 루프 내 반복 접촉'으로 이동한다는 것이다. Claude Platform Docs에 따르면 Fable 5.1은 다단계 웹 리서치와, 발견한 내용을 후속 추적하는 딥리서치 작업의 정확도가 높아졌고, 브라우저와 데스크톱 앱을 더 안정적으로 조작하며 실패한 단계에서 복구한다.
모델이 스스로 후속 추적하는 능력이 강해지면, 브랜드가 답변에 노출되는 방식은 첫 검색결과 한 페이지가 아니라 다단계 탐색 과정에서 반복적으로 크롤·검증되는지 여부에 좌우된다. 다만 이 능력이 실제 인용·노출 증가로 이어지는지는 아직 측정 데이터가 없어 추정이다.
TableFlip 관점
장시간 에이전트 리서치의 대량화는 한국 브랜드 콘텐츠가 AI 에이전트에 의해 '읽히는' 빈도 자체를 늘린다. GEO 관점에서는 단일 핵심 페이지 최적화보다 연쇄 질의를 견디는 근거·수치·출처의 깊이(clarifiable depth)가 중요해진다. TableFlip은 이를 진단 → 구조 개선 → 근거 콘텐츠 → 월간 모니터링의 흐름으로 접근하며, 특히 다단계 딥리서치 루프에서 브랜드가 반복 인용되는지 여부를 AI 노출 리포트로 매주 실측한다.
또한 Mythos 5.1처럼 세이프가드 티어에 따라 동일 모델도 접근이 갈리는 구조는, 금융·헬스케어 등 한국 규제산업 브랜드가 어떤 계층에서 노출되는지를 별도로 점검해야 함을 시사한다. 단, Terminal-Bench-Science 등 수치는 모두 Anthropic 자체 보고이며 독립 검증이 아니라는 점(표준오차 3.5~4.5점 명시)에서 해석에 신중할 필요가 있다.
연쇄 질의를 견디는 콘텐츠 구조를 점검하려면 GEO 진단 방법론부터 확인하고, 무료 AI Visibility 진단으로 다음 단계를 시작할 수 있다.
참고 자료
- Introducing Claude Fable 5.1 and Claude Mythos 5.1 — Anthropic
- What's new in Claude Fable 5.1 — Claude Platform Docs
- Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1 — MarkTechPost
- Claude Fable 5.1: Features, Benchmarks, and Pricing — DataCamp
- Claude Fable 5.1 and Mythos 5.1: What Anthropic's New Models Change — Coursiv
- Breaking: Claude Released Fable 5.1 — AI Discoveries
- LLM Leaderboard (September 2026) — ModelGrep
함께 읽기
- Sakana AI 'Fugu' 오케스트레이션 모델: AI 노출 좌표가 바뀐다2026년 9월 11일 Sakana AI가 단일 모델이 아닌 '학습된 오케스트레이션' 구조의 Fugu Max·Ultra v2를 출시했다. 답변을 생성하는 표면이 특정 모델에서 분리되면서, 브랜드의 AI 노출 최적화는 '모델 타깃'에서 '라우팅 대응'으로 축을 옮겨야 한다.
- GPT-6 Astra 공개: AI 노출축이 '인용'에서 '에이전트 조작'으로OpenAI가 브라우저를 직접 조작하는 GPT-6 Astra를 공개하면서 브랜드 노출의 승부처가 '답변 인용'에서 '에이전트가 실제 페이지에서 작업을 완수하는가'로 이동했다. BrowseComp 점수는 상향 평준화됐고, 이제 차별화는 에이전트가 파싱·조작 가능한 구조화 데이터에서 갈린다.
- Grok 4.6와 X 파이어호스: 브랜드 노출 축이 소셜 실시간으로 이동한다성능·가격이 프런티어 평균에 수렴한 Grok 4.6의 진짜 차별점은 실시간 X 파이어호스 접근이다. 이는 한국 브랜드의 AI 노출 전략이 '웹 페이지 최적화'에서 '소셜 실시간 신호 관리'로 확장돼야 함을 의미한다.
이 리서치는 웹 검색으로 검증된 출처만 근거로 AI 리서치 파이프라인이 작성하고 TableFlip이 검수해 발행합니다. 자사 관련 서술은 ‘TableFlip 관점’ 섹션에 분리 표기합니다 · 리서치 원칙 · CC BY 4.0 — 출처(TableFlip, tableflip.kr) 표기 시 자유 인용 가능