Gemini 3.8 Flash는 Google이 2026년 9월 2일 공개한 최신 Flash급 실무 주력 모델입니다. 장시간 소프트웨어 엔지니어링, 자율 Agent, 기업 다단계 워크플로를 겨냥합니다. Gemini 3 시리즈의 플래그십 Pro가 아니라, 최선단에 가까운 추론·코딩 능력을 Flash의 속도와 도입가에 눌러 담은 제품입니다. 백만 입력 token당 $0.75, 출력 $3.75이며, 유효 기간은 2026년 12월 31일까지입니다.
같은 주 OpenAI는 플래그십 GPT-6 Astra(API 모델 ID gpt-6-astra)를 내놓았습니다. 표준가는 백만 입력당 $10, 출력 $50입니다. 양쪽 모두 Agent, 코딩, 긴 컨텍스트를 내세우지만 청구서 자릿수가 다릅니다. 이 글은 Google 공식 블로그, Gemini API 문서, DeepMind 모델 카드, OpenAI 모델 페이지를 기준으로 기능·성능·가격·API를 분해하고, 현장에 바로 쓸 선정 기준을 제시합니다. 벤더가 스스로 올린 점수를 최종 검수로 쓰지 않습니다.
세 부류 독자를 염두에 둡니다. 기본 모델을 정해야 하는 Agent / 코딩 어시스턴트 팀, 월 청구를 가늠해야 하는 플랫폼과 재무, Gemini Interactions API와 OpenAI Responses API 사이에 어댑터를 짜는 엔지니어입니다.
- 3.8 Flash는 GA 안정 모델입니다. ID는
gemini-3.8-flash이며 preview 접미사가 없습니다. - 도입가는 2026-12-31까지입니다. 2027-01-01부터 표준가는 $1.50 / $7.50입니다.
- 사고 token은 출력으로 청구됩니다. 단계가 높을수록 단가가 같아도 작업당 청구가 뚜렷이 오를 수 있습니다.
Gemini 3.8 Flash란
Google 공식 발표에 따르면 3.8은 Gemini 3 패밀리의 세 번째 Flash 반복이며, 3.7 Flash와는 약 3주 차이입니다. 속도와 도입가는 3.7과 같지만, 소프트웨어 엔지니어링, Agent 작업, 전문 영역의 다단계 추론은 분명히 강해졌습니다. 공식은 동시에 두 변형을 내놓았습니다.
- Gemini 3.8 Flash: 개발자와 기업을 위한 범용 실무 주력. Gemini API, Google AI Studio, Gemini Enterprise, Antigravity, 그리고 Gemini app / Search AI Mode / Sheets(Google AI Pro 또는 Ultra 필요)로 제공합니다.
- Gemini 3.8 Flash Cyber: 취약점 발견과 자동 패치를 위한 방어형 모델. Fairwind 프로그램을 통해서만 신뢰할 수 있는 정부, 핵심 인프라, 소프트웨어 유지보수 주체에 개방됩니다. 이 글은 공개 Flash만 다루며, 비공개 방어 인터페이스는 펼치지 않습니다.
DeepMind 모델 카드는 지식 컷오프가 대체로 2026년 3월이며, 일부 영역은 2025년 1월에 머문다고 명시합니다(Gemini 3 패밀리와 동일). 고노력 단계는 더 느리고 타임아웃이 나기 쉬우며 token도 더 많이 씁니다. 변두리가 아니라, 지연과 청구를 잡을 때 반드시 넣어야 하는 제약입니다.
Google은 3.8 Flash를 Antigravity Agent와 Antigravity SDK의 기본 모델로도 지정했습니다. 새로 연 호스팅 Agent 프로젝트는 설정을 바꾸지 않으면 이 모델을 호출합니다.
기능: 컨텍스트, 사고 단계, 내장 도구
Gemini 최신 모델 문서를 기준으로 공개 능력은 한 장의 스펙 표로 줄일 수 있습니다.
| 스펙 | Gemini 3.8 Flash |
|---|---|
| 모델 ID | gemini-3.8-flash(안정 / GA) |
| 입력 상한 | 1,048,576 token(약 1M) |
| 최대 출력 | 65,536 token(문서에는 64K로도 표기) |
| 사고 단계 | low / medium(기본) / high; minimal은 오류 |
| 입력 모달 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 모달 | 텍스트 |
| 과금 모드 | Standard, Batch, Flex, Priority |
사고 단계는 어떻게 고르나
3.8 Flash의 핵심 노브는 모델 이름을 바꾸는 것이 아니라 thinking_level입니다. 공식 권고는 이렇게 읽으면 됩니다.
- low: 지연에 민감한 초안, 분류, 간단한 다시 쓰기. token 부담이 가장 낮습니다.
- medium(기본): 대부분의 복잡한 코드와 Agent 루프. 첫 라운드 정답률이 보통 더 낫습니다.
- high: 깊은 추론, 수학, 어려운 다단계 오케스트레이션. 모델이 추론 스텝을 더 밟고 도구를 더 부릅니다.
Google 스스로의 표현은 3.8 Flash가 “더 열심히 일한다”(works harder)는 것입니다. 복잡한 작업에서 몇 걸음 더 가고 도구를 반복 호출하며, 높은 단계에서 특히 두드러집니다. 독립 평가에서 high의 작업당 출력 token은 3.7 Flash보다 약 30% 많을 수 있습니다. 단가는 그대로여도 작업당 비용은 오릅니다. 프로덕션 라우팅은 작업 유형별로 단계를 고정하고, 전역 high는 쓰지 마세요.
내장 도구와 입력 모달
3.8 Flash는 Gemini 3의 도구 면을 이어받습니다. 컨텍스트 캐시, 코드 실행, 파일 검색, Function Calling, Structured Output, Search grounding, Maps grounding, URL context. Computer Use는 여전히 Preview입니다. Agent 입장에서는 “모델 + 호스팅 도구”로 먼저 끝까지 돌려 본 뒤, 어떤 동작은 반드시 자체 함수로 되돌려야 할지 정하면 됩니다.
멀티모달 입력은 디자인 시안, 오류 스크린샷, 회의 녹음, PDF 명세를 같은 Agent 작업에 그대로 넣는 쓰임에 맞습니다. 출력은 여전히 텍스트이므로, 업무 시스템에 넘길 때는 Structured Output이나 자체 Schema 검증이 필요합니다. 모델이 덤으로 UI까지 그려 주기를 기대하지 마세요.
generateContent에서 Interactions API로 옮기는 중이라면, 인터페이스 층과 상태 층을 먼저 나눈 뒤 모델 이름을 바꾸세요. 옮기는 순서는 2026 Gemini API 업데이트 이후 Agent가 먼저 고쳐야 할 층을 참고하세요.
성능: 공식 벤치마크와 “더 열심히”의 대가
Google은 3.8 Flash가 여러 공개 벤치마크에서 더 비싼 최선단 모델에 근접하거나 넘어서면서도 Flash 가격을 유지한다고 강조합니다.
- DeepSWE v1.1(장시간 소프트웨어 엔지니어링): 공식은 대부분의 더 큰 최선단 모델보다 낫다고 합니다. 제삼자 대조표에서 흔한 점수는 약 73.7%–73.8%입니다. OpenAI가 GPT-6 Astra에 올린 자체 수치는 74.1%입니다. 같은 mini-swe-agent 프레임워크에서 매우 가깝고, 0.3포인트만으로 승부를 가를 수 없습니다.
- HLE-Verified(학제 다단계 추론): 공식 숫자는 54.9%입니다.
- 전문 Agent: Vals Finance Agent V2, Harvey Legal Agent 등에서 Google은 3.7 Flash와 다른 최선단 모델보다 낫다고 합니다. 벤더가 고른 장면이므로 방향 신호로만 보고, 당신 저장소의 회귀 세트로 삼지 마세요.
Artificial Analysis의 Intelligence Index는 GPT-6 Astra를 한 계단 위에 둡니다(저사고 단계 약 57 vs 52; 고단계 종합 지수는 보도에 따라 59–67로, 집계 기준이 통일되어 있지 않습니다)). 엔지니어링 팀에 더 쓸모 있는 결론은 이겁니다. 코딩 Agent의 통과율은 이미 같은 좁은 띠에 몰려 있고, 청구서를 가르는 것은 token 소모와 단가입니다.
DeepSWE, HLE, GPQA는 평가 스캐폴드, 사고 단계, 도구 스위치에 의존합니다. 저장소나 타임아웃 전략을 바꾸면 순위가 움직입니다. 올리기 전에 자체 20–50개 회귀 작업으로 3.7 Flash, 3.8 Flash, Astra를 비교하고 통과율, thoughtsTokenCount, 경과 시간, 달러 비용을 기록하세요.
가격: 도입 기간, 2027 인상, 과금 함정
아래 표는 Google이 공개한 3.8 Flash 단가를 정리한 것이며, 단위는 모두 달러 / 백만 token입니다. 도입 기간은 2026년 12월 31일까지이고, 2027년 1월 1일부터 표준가가 두 배가 됩니다.
| 모드 | 입력(2026-12-31까지) | 출력(2026-12-31까지) | 입력(2027-01-01부터) | 출력(2027-01-01부터) |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $1.50 | $7.50 |
| Batch / Flex | $0.375 | $1.875 | $0.75 | $3.75 |
| Priority | $1.35 | $6.75 | $2.70 | $13.50 |
빠지기 쉬운 세 가지입니다.
- 사고 token = 출력 token. 응답의
thoughtsTokenCount는 도입기 $3.75/M로 청구에 들어갑니다. 높은 단계 작업이 “보이는 답은 2K자”여도, 실제로는 수만 사고 token을 이미 만들었을 수 있습니다. - 컨텍스트 캐시, Search / Maps grounding은 별도입니다. 캐시에는 쓰기·저장 요금이 있고 2027년에도 조정됩니다. 그라운딩 검색은 무료 한도를 넘기면 요청 단위로 과금됩니다.
- 3.7 Flash는 계속 쓸 수 있습니다. 정답률보다 지연과 token 부담이 더 중요하다면, 공식은 3.7에 남거나 3.8을
low에 고정하라고 분명히 권합니다.
Agent 코딩 세션을 대충 잡아 보면, 입력 80,000 token(저장소 요약 + 이력 + 도구 회신), 출력(사고 포함) 20,000 token입니다. 도입기 Standard는 약 $0.06 + $0.075 = $0.135입니다. 같은 세션을 GPT-6 Astra 표준가(입력 ≤272K)로 돌리면 대략 $0.80 + $1.00 = $1.80, 약 13배입니다. Astra가 입력 272K를 넘긴 뒤 요청 전체가 오르는 분은 아직 넣지 않았습니다.
구독, 초과 API, 클라우드 Mac을 한곳에 모아 월 청구를 보려면 AI 코딩 한 달에 실제로 얼마가 드나를 대조하세요. 멀티모델 게이트웨이의 가산 규칙은 OpenRouter API 가격 비교에 있습니다.
API: 모델 ID, Interactions, generateContent
3.8 Flash는 두 인터페이스로 갈 수 있습니다. 신규 프로젝트는 공식이 Interactions API(POST /v1beta/interactions)를 권합니다. 기존 코드 대부분은 아직 generateContent에 있습니다. 둘 다 같은 모델 ID를 인정합니다.
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Summarize the failing test and propose a patch.",
"generation_config": { "thinking_level": "medium" }
}'
기존 경로는 POST /v1beta/models/gemini-3.8-flash:generateContent입니다. 이전할 때 문자열만 바꾸지 마세요. Interactions는 previous_interaction_id로 이어 달리고, generateContent는 보통 이력을 직접 이어 붙입니다. 도구 루프, 스트리밍 이벤트, call_id 회신은 회귀해야 합니다.
현장에 내릴 때는 네 가지를 고정하는 편이 낫습니다.
- 설정에
gemini-3.8-flash를 박아 두고 “최신 Flash” 별칭에 의존하지 마세요. 조용한 세대 교체를 막습니다. - 라우트별로
thinking_level을 둡니다. 고객 응대 초안은low, 저장소 수정은medium, 수학 / 계획은high. - 로그에
usage와thoughtsTokenCount를 함께 남기세요. 없으면 월 청구가 맞지 않습니다. - Structured Output은 최종 JSON을, Function Calling은 중간 동작을 맡기세요. 하나의 Schema로 섞지 마세요.
소비자 입구는 Gemini app과 Search AI Mode입니다. 프로덕션 Agent는 Gemini API 또는 Gemini Enterprise로 가고, 키·쿼터·데이터 보존은 따로 관리하세요. Interactions의 서버 상태에는 보존 기한이 있으므로, 감사 로그는 자체 저장소에 남겨야 합니다.
GPT-6 Astra와 어떻게 비교하나
GPT-6 Astra는 OpenAI가 2026년 9월 초에 내놓은 플래그십으로, “가장 어려운 엔드투엔드 작업”을 겨냥합니다. 복잡한 추론, 코딩, Computer Use, 리서치, 긴 문서입니다. 스펙은 OpenAI 모델 페이지에서 가져왔습니다.
| 항목 | Gemini 3.8 Flash | GPT-6 Astra |
|---|---|---|
| 포지션 | 최강 Flash 실무 주력 / Agent 기본 모델 | 플래그십, 가장 어려운 작업 |
| 모델 ID | gemini-3.8-flash |
gpt-6-astra |
| 출시 | 2026-09-02(GA) | 2026-09-03 발표, API는 약 09-04 |
| 컨텍스트 / 최대 출력 | 약 1.05M / 64K–65K | 1,050,000 / 128,000 |
| 사고 제어 | thinking_level: low / medium / high |
reasoning.effort: low–max(none 없음) |
| 표준 단가(장문 문턱 이하) | $0.75 / $3.75(도입기) | $10 / $50; 캐시 입력 $1, 쓰기 $12.50 |
| 장문 컨텍스트 할증 | 공개 표에 272K 문턱을 따로 두지 않음 | 입력 >272K: 요청 전체 입력/캐시 2×, 출력 1.5× |
| 주 인터페이스 | Interactions API + generateContent | Responses API(도구 면이 더 넓음) |
| 입력 모달 | 텍스트 / 이미지 / 비디오 / 오디오 / PDF | 텍스트 + 이미지 |
| 지식 컷오프 | 대체로 2026-03(일부 2025-01) | 2026-04-30 |
| DeepSWE v1.1 | 약 73.7%–73.8%(대조표) | 74.1%(OpenAI 자체 발표) |
Astra의 도구 면은 “호스트가 맡아 주는” 쪽에 가깝습니다. 웹 검색, 파일 검색, 이미지 생성, Code Interpreter, 호스팅 Shell, Apply Patch, Computer Use, Tool Search입니다. 3.8 Flash의 강점은 멀티모달 입력, 도입가, Google 검색 / 지도 / Workspace 그라운딩입니다. Astra는 초장문 입력에서 요청 전체가 오릅니다. 저장소 전체나 백만 token 분량의 서류를 한 번에 넣으면 단가가 $10/$50에서 $20/$75가 됩니다.
Batch / Flex는 양쪽 모두 표준가의 약 절반입니다. Astra에는 Fast(약 2×)가 있고, Gemini의 대응은 Priority(약 1.8×)입니다. 비교할 때는 같은 서비스 등급을 맞춰야 합니다. 그렇지 않으면 “싸지만 줄 설 수 있는 것”과 “비싸지만 선점하는 것”을 섞어 보는 셈입니다.
어떻게 고르고, 어떻게 라우팅하나
“최신 플래그십”을 유일한 기본값으로 두지 마세요. 더 안정적인 방법은 작업을 나누는 것입니다.
- 기본은 3.8 Flash
medium: 일상 코드 수정, 티켓, 검색 증강, 대부분의 Agent 루프. 도입기 가성비가 가장 좋습니다. - 지연에 민감하면 3.8 Flash
low이거나 3.7 Flash를 남기세요: 자동완성, 분류, 짧은 답. p95를 먼저 보고 통과율을 다음에 보세요. - 어려운 작업은 Astra 또는 3.8 Flash
high로 올리세요: 저장소 간 리팩터, Computer Use, 긴 문서에서 바늘 찾기, 128K 출력이 필요한 보고서. 섀도 트래픽으로 통과율과 달러를 비교한 뒤 주 경로를 바꾸세요. - 2027년 예산은 $1.50 / $7.50로 다시 짜세요. 도입가가 사라진 뒤에도 3.8 Flash는 Astra보다 훨씬 싸지만, “거의 공짜인 최선단”은 아닙니다.
Agent의 진짜 비용은 종종 모델이 아니라 실행 환경에 있습니다. Mac에서 Xcode, 서명, 시뮬레이터, 로컬 도구 루프를 돌려야 하면 모델 청구와 머신 청구를 나눠 계산해야 합니다. Zilmac 클라우드 Mac은 안정된 Apple 툴체인을 고정 노드에 두고, API로 3.8 Flash 또는 Astra를 호출하기에 맞습니다. 키, 서명, GPU 추론을 한 대에 쌓지 마세요.
자주 묻는 질문
Gemini 3.8 Flash와 Gemini 3.8 Pro는 같은 모델인가?
아닙니다. 3.8 Flash는 Flash급 실무 주력이며, 공식은 “3.7과 같은 속도·같은 가격, 추론은 더 강하다”고 강조합니다. 이 글을 쓰는 시점(2026-09-08) 기준 공개 GA의 주력은 gemini-3.8-flash입니다. Flash 도입가를 아직 대조하지 않은 Pro 요금표에 얹지 마세요.
3.8 Flash Cyber를 일반 Gemini API Key로 호출할 수 있나?
일반 개발자 쿼터로 이해하면 안 됩니다. Cyber는 Fairwind를 타며 신뢰할 수 있는 방어 주체를 향합니다. 일반 프로덕션과 소비 장면은 3.8 Flash를 쓰세요.
3.7 Flash에서 3.8로 올리려면 모델 이름만 바꾸면 되나?
모델 ID는 먼저 바꿔도 되지만, 도구 루프, Structured Output, 사고 단계는 반드시 회귀해야 합니다. 3.8은 도구를 더 부르고 사고 token을 더 쓸 수 있어 지연과 청구가 모두 변합니다. 먼저 5%–10% 트래픽으로 비교한 뒤 전량 전환하세요.
Gemini 3.8 Flash와 GPT-6 Astra 중 누가 더 강한가?
통일된 답은 없습니다. DeepSWE에서는 거의 비기고, Astra는 일부 종합 지능 지수와 도구 면에서 앞서며, 3.8 Flash는 단가, 멀티모달, 도입 창에서 앞섭니다. 발표 슬라이드가 아니라 당신 회귀 세트와 달러/작업을 기준으로 하세요.
한 줄 결론
- 3.8 Flash: 2026년 가을 기본 Agent / 코딩 모델로 가성비가 좋습니다. 먼저
medium에 고정하고 사고 token을 지켜보세요. - Astra: 진짜 어렵고 $10/$50을 낼 만한 작업에 남기세요. 272K 문턱과 캐시 쓰기 요금에 주의하세요.
- 2027-01-01: 두 배가 된 Flash 가격으로 예산을 다시 짜세요. 도입가를 연간 계약에 넣지 마세요.
모델은 API로, 빌드는 클라우드 Mac으로
Gemini 3.8 Flash와 GPT-6 Astra가 푸는 것은 추론입니다. iOS / macOS 파이프라인에는 여전히 Xcode, 서명, 안정된 노드가 필요합니다. Zilmac 클라우드 Mac은 Agent의 실행 환경을 고정하기에 맞습니다.
모델과 머신은 따로 과금하고 따로 늘립니다. — 클라우드 Mac 요금제 보기