본문으로 건너뛰기

DeepSeek V4-Flash 0731: 재훈련만으로 상위 모델 추월, 에이전트 경제성이 바뀐다

TableFlip Research·· LLM·모델· DeepSeek· LLM· 에이전트모델· GEO· AI Visibility

핵심 요약

  • DeepSeek는 2026년 7월 31일 DeepSeek-V4-Flash-0731을 Hugging Face에 MIT 라이선스로 공개하고 공식 API를 퍼블릭 베타로 전환했다(출처: MarkTechPost).
  • 아키텍처와 파라미터 수(총 2,840억, 활성 130억 MoE)는 4월 프리뷰와 동일하며, 모든 개선은 재훈련에서 나왔다.
  • Terminal-Bench에서 V4-Flash-0731은 82.7점으로, 4월 프리뷰의 56.9점 대비 25.8점 상승했다(출처: Vercel AI Gateway).
  • 독립 평가인 Artificial Analysis Intelligence Index에서 52점을 기록해 비교 가능 모델 중앙값(26)을 크게 웃돌았다(출처: Artificial Analysis).
  • DeepSeek 가격표 기준 출력 100만 토큰당 $0.28, 동시성 한도 2,500으로 V4-Pro 대비 약 3분의 1 가격에 처리량은 5배(2,500 대 500)다(출처: MarkTechPost, AIToolsReview).

이번 업데이트가 왜 특별한가?

결론부터 말하면 '더 큰 모델'이 아니라 '같은 모델을 다시 훈련한 것'만으로 상위 모델을 따라잡았다는 점이다. DeepSeek 자료에 따르면 아키텍처와 파라미터 수(총 2,840억, 활성 130억 MoE 구조)는 4월 프리뷰와 동일하며, 개선은 전적으로 재훈련(사후훈련)에서 나왔다. 이는 2026년 업계 흐름, 즉 파라미터 수보다 사후훈련 품질을 중시하고 에이전트형 워크로드를 소형 모델로 라우팅하는 패턴과 맞닿아 있다. 다만 개선을 특정 훈련 요소에 귀속시킬 근거는 아직 없으며, DeepSeek가 훈련 레시피나 ablation을 공개하기 전까지 인과 해석은 추측에 머문다.

성능은 실제로 얼마나 올랐나?

독립 평가와 벤더 발표가 모두 상승을 가리키지만, 신뢰 수준은 구분해야 한다.

지표 출처 유형
Terminal-Bench 82.7점 (프리뷰 56.9점) Vercel AI Gateway
Intelligence Index 52점 (중앙값 26) Artificial Analysis(독립)
에이전트·코딩 벤치 활성 파라미터 1/3 미만으로 V4-Pro-Preview 상회 DeepSeek 자체 표(벤더 주장)

DeepSeek 자체 표는 활성 파라미터가 3분의 1 미만임에도 대부분의 에이전트·코딩 벤치마크에서 V4-Pro-Preview를 앞선다고 주장하나, 이는 벤더 자체 비교이므로 독립 재현 전까지 참고치로 다뤄야 한다.

가격·배포 조건은?

DeepSeek 가격표 기준 캐시 미스 입력 100만 토큰당 $0.14, 캐시 히트 $0.0028, 출력 100만 토큰당 $0.28이며 동시성 한도는 2,500이다(출처: MarkTechPost). AIToolsReview에 따르면 V4-Pro 대비 약 3분의 1 가격이면서 동시 요청 처리량은 5배(2,500 대 500)를 지원한다.

  • 라이선스: 가중치는 MIT로 게이트 없이 공개(출처: MarkTechPost)
  • 자체 호스팅 부담: 130억만 활성화돼도 모든 expert가 메모리에 상주해야 함
  • API 이용: 9개 제공사를 통해 이용 가능(출처: Artificial Analysis)

felloai는 이를 "새로운 가격 대비 성능 픽"으로 평가했다.

TableFlip 관점

이번 사건의 요체는 '벤치 1등'이 아니라 '에이전트 작업의 경제성'이다. 에이전트 루프(검색→툴 호출→요약→인용)를 대량으로 돌리는 단가가 낮아지면, 국내에서도 AI 답변엔진·리서치 에이전트·쇼핑 에이전트가 더 자주, 더 많은 웹페이지를 순회하며 브랜드를 인용·추천하게 된다. 브랜드가 AI 참조 소스로 선택되기 위한 GEO(콘텐츠 구조화·인용 가능성 최적화)의 ROI가 그만큼 커진다는 뜻이다.

주력이 소수 플래그십이 아니라 각기 사후훈련된 다수 저가 에이전트 모델로 다변화되므로, 특정 모델 한 곳에 맞춘 최적화보다 '기계가 읽기 쉬운 구조화 데이터'라는 공통분모에 투자하는 편이 안전하다. TableFlip은 이 변화를 진단 → 구조 개선 → 근거 콘텐츠 → 월간 모니터링의 실무 흐름으로 대응하며, 여러 모델의 인용 방식 차이를 매주 AI 노출 리포트로 실측한다. 자사 브랜드가 현재 어떤 답변에서 어떻게 인용되는지 궁금하다면 GEO 진단 방법론을 먼저 확인해볼 것을 권한다.

다음 단계로 무료 AI Visibility 진단을 통해 우리 브랜드의 AI 노출 현황을 점검해보자.

참고 자료

  1. DeepSeek Upgrades DeepSeek-V4-Flash-0731 (MarkTechPost)
  2. DeepSeek V4 Flash 0731 (Artificial Analysis)
  3. DeepSeek V4 Flash 0731 (Vercel AI Gateway)
  4. DeepSeek V4 Flash 0731: Benchmarks, Pricing & Review (AIToolsReview)
  5. Best AI Models in August 2026 (felloai)

함께 읽기

이 리서치는 웹 검색으로 검증된 출처만 근거로 AI 리서치 파이프라인이 작성하고 TableFlip이 검수해 발행합니다. 자사 관련 서술은 ‘TableFlip 관점’ 섹션에 분리 표기합니다 · 리서치 원칙 · CC BY 4.0 — 출처(TableFlip, tableflip.kr) 표기 시 자유 인용 가능