본문으로 건너뛰기

Claude Fable 5.1 출시: '장시간 리서치'가 프런티어 기준이 되다

TableFlip Research·· LLM·모델· Claude· Anthropic· LLM· GEO· AI Visibility

핵심 요약

  • Anthropic은 2026년 9월 1일 Claude Fable 5.1과 트러스티드 액세스 쌍둥이 Mythos 5.1을 하나의 기반 모델로 출시했다(Anthropic 발표).
  • 에이전틱 과학 연구 벤치마크 Terminal-Bench-Science 0.1에서 Fable 5.1은 52.6%를 기록해 Opus 5(29.0%), Fable 5(24.7%), GPT-5.6 Sol(22.4%)을 앞섰다(Anthropic 자체 보고, 표준오차 3.5~4.5점).
  • 캐시 리드 가격을 100만 토큰당 $1.00에서 $0.25로 75% 인하했으며, Anthropic은 이를 일반 워크로드 약 25%, 에이전틱 워크로드 최대 45% 비용 절감으로 측정한다(MarkTechPost).
  • Fable 5.1은 100만 토큰 컨텍스트 윈도우를 가지며 단일 응답에서 최대 128,000 토큰까지 생성한다(AI Discoveries).
  • Artificial Analysis Intelligence Index 65.7로 리더보드 1위이며 Claude Opus 5(63.1), Fable 5(62.1)를 앞선다(ModelGrep).

Fable 5.1의 진짜 변화는 무엇인가?

결론부터 말하면, 이번 릴리스의 핵심은 단일 벤치마크 점수가 아니라 가격 구조와 능력의 방향이 모두 '장시간 자율 에이전트 리서치'로 이동했다는 점이다. Anthropic 발표에 따르면 Fable 5.1과 Mythos 5.1은 9월 1일 하나의 기반 모델로 출시됐으며, Fable은 널리 이용 가능하고 Mythos는 Project Glasswing 하의 검증된 사이버보안·생명과학 프로그램에만 제한된다.

Coursiv에 따르면 가장 큰 개선은 장시간 에이전틱 작업에 집중돼 있다. 단기 벤치마크는 몇 점만 움직인 반면, 장시간 작업 지표는 크게 올랐다.

벤치마크 Fable 5.1 비교
Terminal-Bench-Science 0.1 52.6% Fable 5는 24.7%
Terminal-Bench 4.0 55.8%
AutomationBench 31.4%
Intelligence Index 65.7 Opus 5 63.1

가격 구조는 왜 중요한가?

핵심 상업 지표는 캐시 리드 75% 인하다. MarkTechPost에 따르면 기본 입력·출력 가격은 100만 토큰당 $10·$50로 변동이 없지만, 캐시 리드는 $1.00에서 $0.25로 내려갔다. DataCamp는 정가를 유지하면서 캐시 리드만 75% 인하한 것이 어떤 단일 벤치마크 행보보다 흥미로운 움직임이라 평했다.

이는 Anthropic이 프런티어가 채팅 턴이 아니라 무인 가동 시간(unattended hours)으로 측정되는 데 베팅하고 있으며, 그 베팅이 저렴해지도록 가격을 책정했음을 보여준다.

검색·브라우징 능력은 브랜드 노출에 어떤 영향을 주나?

답은 노출 접점이 '한 번의 인용'에서 '리서치 루프 내 반복 접촉'으로 이동한다는 것이다. Claude Platform Docs에 따르면 Fable 5.1은 다단계 웹 리서치와, 발견한 내용을 후속 추적하는 딥리서치 작업의 정확도가 높아졌고, 브라우저와 데스크톱 앱을 더 안정적으로 조작하며 실패한 단계에서 복구한다.

모델이 스스로 후속 추적하는 능력이 강해지면, 브랜드가 답변에 노출되는 방식은 첫 검색결과 한 페이지가 아니라 다단계 탐색 과정에서 반복적으로 크롤·검증되는지 여부에 좌우된다. 다만 이 능력이 실제 인용·노출 증가로 이어지는지는 아직 측정 데이터가 없어 추정이다.

TableFlip 관점

장시간 에이전트 리서치의 대량화는 한국 브랜드 콘텐츠가 AI 에이전트에 의해 '읽히는' 빈도 자체를 늘린다. GEO 관점에서는 단일 핵심 페이지 최적화보다 연쇄 질의를 견디는 근거·수치·출처의 깊이(clarifiable depth)가 중요해진다. TableFlip은 이를 진단 → 구조 개선 → 근거 콘텐츠 → 월간 모니터링의 흐름으로 접근하며, 특히 다단계 딥리서치 루프에서 브랜드가 반복 인용되는지 여부를 AI 노출 리포트로 매주 실측한다.

또한 Mythos 5.1처럼 세이프가드 티어에 따라 동일 모델도 접근이 갈리는 구조는, 금융·헬스케어 등 한국 규제산업 브랜드가 어떤 계층에서 노출되는지를 별도로 점검해야 함을 시사한다. 단, Terminal-Bench-Science 등 수치는 모두 Anthropic 자체 보고이며 독립 검증이 아니라는 점(표준오차 3.5~4.5점 명시)에서 해석에 신중할 필요가 있다.

연쇄 질의를 견디는 콘텐츠 구조를 점검하려면 GEO 진단 방법론부터 확인하고, 무료 AI Visibility 진단으로 다음 단계를 시작할 수 있다.

참고 자료

  1. Introducing Claude Fable 5.1 and Claude Mythos 5.1 — Anthropic
  2. What's new in Claude Fable 5.1 — Claude Platform Docs
  3. Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1 — MarkTechPost
  4. Claude Fable 5.1: Features, Benchmarks, and Pricing — DataCamp
  5. Claude Fable 5.1 and Mythos 5.1: What Anthropic's New Models Change — Coursiv
  6. Breaking: Claude Released Fable 5.1 — AI Discoveries
  7. LLM Leaderboard (September 2026) — ModelGrep

함께 읽기

이 리서치는 웹 검색으로 검증된 출처만 근거로 AI 리서치 파이프라인이 작성하고 TableFlip이 검수해 발행합니다. 자사 관련 서술은 ‘TableFlip 관점’ 섹션에 분리 표기합니다 · 리서치 원칙 · CC BY 4.0 — 출처(TableFlip, tableflip.kr) 표기 시 자유 인용 가능