Gemini 3.8 Flash 출시: Opus 5급 코딩을 7분의 1 가격에, 벤치마크 숫자와 론칭 가격 분석

Apptics 편집장 서상덕이 공식 Gemini API 문서와 Google DeepMind 모델 카드를 바탕으로 정리한 기술 분석 글입니다.

코딩 벤치마크에서 Claude Opus 5와 거의 같은 점수를 내는데, 가격은 입력 토큰 기준 7분의 1입니다. 구글이 방금 내놓은 Gemini 3.8 Flash 이야기예요. “플래시 모델은 가벼운 작업용”이라는 공식이 깨졌습니다. 롱런 코딩, 자율 에이전트, 기업 워크플로우를 정조준한 플래그십급 플래시가 나왔거든요.

이 글에서는 공식 문서와 모델 카드에 공개된 수치를 기준으로 ① 무엇이 달라졌는지 ② 벤치마크를 어떻게 읽어야 하는지 ③ 언제 써야 이득인지를 정리합니다.

핵심만 먼저 보면:

  • DeepSWE v1.1 73.7% — Opus 5(74.0%)와 사실상 동급, 직전 세대 3.7 Flash(65.3%)보다 +8.4%p
  • 입력 $0.75 / 출력 $3.75 (100만 토큰) — 2026년 12월 31일까지만 적용되는 론칭 가격
  • 컨텍스트 100만 토큰, 출력 64K, thinking 레벨 3단계 조절 — Managed Agents(Antigravity) 기본 모델로 채택

Gemini 3.8 Flash, 어떤 모델인가

2026년 9월 정식 출시(GA)된 Gemini 3.8 Flash는 이름 그대로 “가장 똑똑한 플래시 모델”을 표방합니다. 구글의 설명은 명확해요. 장시간 이어지는 소프트웨어 엔지니어링, 자율 에이전트, 복잡한 엔터프라이즈 워크플로우를 플래시의 속도와 비용으로 처리하겠다는 겁니다.

아키텍처는 Gemini 3.7 Flash를 기반으로 개선한 형태입니다. 완전히 새로운 구조가 아니라, 같은 뼈대에서 성능을 끌어올린 반복 개선이라는 뜻이에요.

항목 스펙
모델 ID gemini-3.8-flash
입력 / 출력 한도 입력 1,048,576 토큰(약 100만) / 출력 65,536 토큰(64K)
지원 입력 텍스트·이미지·영상·오디오·PDF (출력은 텍스트)
사고 레벨 low / medium(기본) / high — minimal 미지원
주요 기능 코드 실행, 함수 호출, 구조화 출력, Google 검색·지도 그라운딩, 파일 검색, URL 컨텍스트, 캐싱, 컴퓨터 사용(프리뷰)
소비 옵션 Batch API · Flex · Priority 추론
지식 기준 시점 2026년 3월 (일부 도메인은 2025년 1월)

바로 테스트해보고 싶다면 AI Studio에서 모델 선택만 바꾸면 됩니다.

Google AI Studio에서 바로 써보기

벤치마크 숫자 읽기: 이긴 곳, 진 곳 솔직하게

구글은 모델 카드와 함께 공식 평가 문서를 공개했습니다. 아래는 그 문서의 비교 표예요. Gemini 3.8 Flash / 3.7 Flash, Claude Opus 5 / Sonnet 5, GPT-5.6 Sol / Terra 여섯 개 모델을 나란히 놓고 있습니다.

Gemini 3.8 Flash 출시: Opus 5급 코딩을 7분의 1 가격에, 벤치마크 숫자와 론칭 가격 분석
Google DeepMind 공식 평가 문서(2026년 9월)의 벤치마크 비교 표. 파란색 강조가 3.8 Flash가 1위인 항목이다.

핵심 항목만 추리면 이렇습니다.

벤치마크 Gemini 3.8 Flash Opus 5 GPT-5.6 Sol
DeepSWE v1.1 (장기 코딩) 73.7% 74.0% 72.7%
Terminal-Bench 2.1 (터미널 에이전트) 89.4% 89.1% 88.8%
GDPVal-AA v2 (지식 업무, Elo) 1545 1824 1710
CharXIV (차트 추론) 86.2% 83.7% 85.8%
HLE-Verified (전문가 추론) 54.9% 54.4% 54.5%
OSWorld 2.0 (컴퓨터 사용) 59.0% 75.4% 62.6%
Vals Finance Agent v2 (금융) 61.4% 58.6% 53.8%
Harvey Legal Agent (법률) 10.0% 6.7% 2.5%

읽는 법을 정리하면 이렇습니다.

  • 코딩·터미널 에이전트는 사실상 최상위권. DeepSWE와 Terminal-Bench 2.1에서 Opus 5와 소수점 차이입니다. 직전 세대 대비 상승 폭(+8.4%p)이 체감 포인트예요.
  • 금융·법률 특화 에이전트 작업에서는 1위. Vals Finance 61.4%, Harvey Legal 10.0%로 전체 모델 중 가장 높습니다. 기업용 워크플로우 강조가 빈말이 아니에요.
  • 진 곳도 있습니다. GDPVal-AA(일반 지식 업무)와 Terminal-Bench 4.0, OSWorld 2.0, PDF 이해에서는 Opus 5나 GPT-5.6 Sol이 앞섭니다. 특히 Terminal-Bench 4.0은 19.1%로 Opus 5(51.8%)와 격차가 커요.

즉 “모든 면에서 최강”이 아니라, 롱런 코딩과 에이전트 반복 작업에 성능을 집중 배분한 모델로 읽는 게 정확합니다.

공식 벤치마크 방법론 문서 보기

가격: 2026년 연말까지가 기회다

이번 출시의 진짜 무기는 가격입니다. 론칭 특별가로 입력 $0.75 / 출력 $3.75(100만 토큰당)가 2026년 12월 31일까지 적용돼요. 비교하면:

  • Claude Opus 5: 입력 $5.00 / 출력 $25.00 → 3.8 Flash가 입력 기준 약 6.7배 저렴
  • GPT-5.6 Sol: 입력 $4.00 / 출력 $20.00
  • 직전 세대 3.7 Flash와 가격은 동일 — 성능만 올라간 셈

주의할 점은 2027년 1월 1일부터 표준 가격(입력 $1.50 / 출력 $7.50)으로 오른다는 겁니다. 그래도 경쟁 플래그십 대비 절반 이하 수준이지만, 지금의 가성비는 기간 한정이에요.

비용을 더 줄이는 공식 옵션도 있습니다. Batch API는 50% 할인(론칭가 기준 $0.375/$1.875), 컨텍스트 캐싱도 지원합니다. 무료 티어에서는 제한적으로 무료 사용이 가능하니 개인 프로젝트는 이걸로 시작하면 됩니다.

Gemini API 요금표 상세 보기

실무에서 언제 쓸까: 판단 기준 3가지

결론부터 말하면 이 모델은 “여러 단계에 걸쳐 도구를 부르며 오래 버텨야 하는 작업”에 맞춰져 있어요.

  1. 코딩 에이전트·리팩터링 파이프라인 — DeepSWE·Terminal-Bench 점수가 증명하는 영역입니다. 구글의 Managed Agents 기본 모델도 이걸로 교체됐어요.
  2. 대량 문서·데이터 처리 — 100만 토큰 컨텍스트에 Batch API 50% 할인을 결합하면 대규모 요약·추출 단가를 크게 낮출 수 있습니다.
  3. 실시간 챗처럼 빠른 응답이 필요한 작업 — thinking 레벨을 low로 내리면 지연을 줄일 수 있어요. 반대로 수학·고난도 추론은 high로.

반대로 일반적인 지식 업무나 단순 질의응답 중심이라면, 토큰을 많이 쓰는 이 모델의 설계 특성상 3.7 Flash나 더 가벼운 모델이 나을 수 있습니다. 구글도 이 점을 공식 문서에서 직접 언급했어요.

개발자 주의: 마이그레이션 함정 체크리스트

기존 Gemini API 코드를 그대로 옮기면 깨지는 부분이 있습니다. 공식 마이그레이션 가이드의 핵심만 추렸어요.

  • ✅ 모델 ID를 gemini-3.8-flash로 교체
  • temperature, top_p, top_k 파라미터 제거 (지원 중단)
  • thinking_budgetthinking_level 문자열(low/medium/high)로 교체 — minimal은 미지원, 호출 시 에러
  • candidate_count 제거 (Gemini 3 이후 미지원)
  • ✅ 멀티턴 대화는 서버 측 previous_interaction_id 방식으로 정리, prefilled 모델 턴 제거
  • ✅ generateContent API 사용 시 FunctionResponse에 call_id·name 필수 포함

새 Interactions API 기준 최소 코드는 이렇습니다.

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="결제 파이프라인의 race condition을 분석하고 안전하게 재작성해줘.",
    generation_config={"thinking_level": "medium"}
)

print(interaction.output_text)

공식 모델 문서 바로 가기

직접 확인한 점, 그리고 한계

이 글의 수치는 모두 구글 공식 문서(모델 페이지, 가격표, 모델 카드, 평가 방법론 문서)에서 확인했습니다. 다만 벤치마크는 구글이 자체 측정한 값과 경쟁사 자기보고 수치를 섞은 것이라, 제3자 독립 검증과는 다를 수 있어요. Artificial Analysis 같은 독립 기관의 측정이 올라오면 이 글도 업데이트하겠습니다.

에디터 의견 하나. 이번 출시의 포인트는 “플래시가 플래그십을 잡았다”가 아니라 “에이전트 작업의 비용 기준선이 내려왔다”는 겁니다. 코딩 에이전트를 돌릴 때 토큰 비용 때문에 브레이크를 걸던 팀이라면, 연말까지의 론칭 가격 구간이 현실적인 실험 창구예요.

FAQ

Q. Gemini 3.8 Flash는 지금 바로 쓸 수 있나요?
네. GA(정식 출시) 상태라 Google AI Studio와 Gemini API에서 바로 사용할 수 있습니다.

Q. 3.7 Flash에서 꼭 넘어가야 하나요?
코딩·에이전트 작업 비중이 높다면 체감이 큽니다(DeepSWE +8.4%p). 다만 단순 작업 위주라면 3.7 Flash도 계속 지원되므로 가격을 비교해 선택하면 됩니다.

Q. 론칭 가격은 언제 끝나나요?
2026년 12월 31일까지 $0.75/$3.75가 적용되고, 2027년 1월 1일부터 $1.50/$7.50로 오릅니다. 3.6·3.7 Flash도 같은 시점에 인상돼요.

Q. 이미지 생성이나 음성 대화도 되나요?
아니요. 이미지 생성, 오디오 생성, Live API는 미지원입니다. 이미지 생성은 Nano Banana 2, 실시간 음성은 별도 Live 모델을 써야 해요.

마무리

Gemini 3.8 Flash는 “저렴한 보급형”이라는 플래시 시리즈의 포지션을 바꾼 모델입니다. 롱런 코딩 벤치마크에서 플래그십과 동급, 금융·법률 에이전트 작업에서는 1위, 가격은 연말까지 절반. 에이전트 기반 자동화를 고민하던 팀이라면 이 론칭 가격 구간에서 먼저 테스트해볼 가치가 충분합니다.

시작은 AI Studio에서 모델만 바꿔보는 것부터면 됩니다.

Gemini 3.8 Flash 무료로 시작하기

함께 읽으면 좋은 글