Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日发布的最新 Flash 级工作马模型,定位长程软件工程、自主 Agent 和企业多步工作流。它不是 Gemini 3 系列的旗舰 Pro,而是把接近前沿的推理与编程能力,压进 Flash 的速度和导入价:每百万输入 token $0.75、输出 $3.75,有效期到 2026 年 12 月 31 日。
同一周,OpenAI 放出旗舰 GPT-6 Astra(API 模型 ID gpt-6-astra),标准价是每百万输入 $10、输出 $50。两边都主打 Agent、编程和长上下文,但账单差了一个数量级。本文按 Google 官方博客、Gemini API 文档、DeepMind 模型卡和 OpenAI 模型页,拆功能、性能、价格与 API,并给出可落地的选型,不把厂商自报分数当成最终验收。
适合三类读者:要决定默认模型的 Agent / 编程助手团队;要估月账单的平台与财务;要在 Gemini Interactions API 和 OpenAI Responses API 之间做适配层的工程师。
- 3.8 Flash 是 GA 稳定模型,ID 就是
gemini-3.8-flash,没有 preview 后缀。 - 导入价只到 2026-12-31;2027-01-01 起标准价变为 $1.50 / $7.50。
- 思考 token 按输出计费。档位越高,单任务账单可能明显上升,即使单价没变。
Gemini 3.8 Flash 是什么
按 Google 官方发布说明,3.8 是 Gemini 3 家族的第三次 Flash 迭代,距离 3.7 Flash 大约三周。它和 3.7 同速、同导入价,但在软件工程、Agent 任务和专业领域多步推理上明显加强。官方同时放出两个变体:
- Gemini 3.8 Flash:面向开发者和企业的通用工作马,走 Gemini API、Google AI Studio、Gemini Enterprise、Antigravity,以及 Gemini app / Search AI Mode / Sheets(需 Google AI Pro 或 Ultra)。
- Gemini 3.8 Flash Cyber:面向漏洞发现与自动补丁的防御向模型,只通过 Fairwind 计划向受信任的政府、关键基础设施和软件维护方开放。本文只讨论公开可用的 Flash,不展开未公开的防御接口。
DeepMind 模型卡写明:知识截止日期多为 2026 年 3 月,部分领域仍停留在 2025 年 1 月(与 Gemini 3 家族一致)。高努力档位可能更慢、更容易超时,也会消耗更多 token。这些不是边角料,而是估延迟和账单时必须算进去的约束。
Google 还把 3.8 Flash 设为 Antigravity Agent 与 Antigravity SDK 的默认模型。新开的托管 Agent 项目,若不改配置,调用的就是它。
功能:上下文、思考档位与内置工具
按 Gemini 最新模型文档,公开能力可以压成一张规格表:
| 规格 | Gemini 3.8 Flash |
|---|---|
| 模型 ID | gemini-3.8-flash(稳定 / GA) |
| 输入上限 | 1,048,576 token(约 1M) |
| 最大输出 | 65,536 token(文档亦写作 64K) |
| 思考档位 | low / medium(默认)/ high;minimal 会报错 |
| 输入模态 | 文本、图片、视频、音频、PDF |
| 输出模态 | 文本 |
| 计费模式 | Standard、Batch、Flex、Priority |
思考档位怎么选
3.8 Flash 的核心旋钮是 thinking_level,不是再换一个模型名。官方建议可以这样理解:
- low:延迟敏感、草稿、分类、简单改写。token 开销最低。
- medium(默认):大多数复杂代码和 Agent 循环。首轮正确率通常更好。
- high:深推理、数学、难的多步编排。模型会多走推理步、多调工具。
Google 自己的表述是:3.8 Flash“更卖力”(works harder)。复杂任务上它会多走几步、反复调工具,高档位尤其明显。独立评测里,high 的单任务输出 token 可能比 3.7 Flash 高三成左右——单价没变,单任务成本照样涨。生产路由应按任务类型锁档位,不要全局 high。
内置工具与输入模态
3.8 Flash 继承 Gemini 3 的工具面:上下文缓存、代码执行、文件搜索、Function Calling、Structured Output、Search grounding、Maps grounding、URL context;Computer Use 仍是 Preview。对 Agent 来说,这意味着“模型 + 托管工具”可以先跑通,再决定哪些动作必须回到你自己的函数。
多模态输入适合:把设计稿、报错截图、会议录音或 PDF 规范直接塞进同一条 Agent 任务。输出仍是文本,所以最终交付给业务系统时,仍要用 Structured Output 或你自己的 Schema 校验,而不是指望模型“顺便”画出界面。
若你还在从 generateContent 迁到 Interactions API,接口层和状态层应先拆开,再换模型名。迁移顺序见 2026 Gemini API 更新后 Agent 先改哪一层。
性能:官方基准与“更卖力”的代价
Google 强调 3.8 Flash 在多个公开基准上接近甚至超过更贵的前沿模型,同时保持 Flash 价:
- DeepSWE v1.1(长程软件工程):官方称优于多数更大的前沿模型;第三方对照表常见分数约 73.7%–73.8%。OpenAI 给 GPT-6 Astra 的自报是 74.1%。两者在同一套 mini-swe-agent 框架上非常接近,不能单凭 0.3 个百分点定胜负。
- HLE-Verified(跨学科多步推理):官方数字 54.9%。
- 专业 Agent:Vals Finance Agent V2、Harvey Legal Agent 等,Google 称优于 3.7 Flash 和其他前沿模型。这些是厂商选定场景,应当作方向信号,不是你仓库里的回归集。
Artificial Analysis 的 Intelligence Index 把 GPT-6 Astra 放在更高一档(低思考档约 57 vs 52;高档综合指数常见报道在 59–67,口径并不统一)。对工程团队更有用的结论是:编程 Agent 的通过率已经挤在同一条窄带上,真正拉开账单的是 token 消耗和单价。
DeepSWE、HLE、GPQA 都依赖评测脚手架、思考档位和工具开关。换一套仓库、换一种超时策略,名次就会动。上线前用自己的 20–50 条回归任务对比 3.7 Flash、3.8 Flash 和 Astra,记录通过率、thoughtsTokenCount、墙钟时间和美元成本。
价格:导入期、2027 涨价与计费坑
下表按 Google 公布的 3.8 Flash 单价整理,单位均为美元 / 百万 token。导入期到 2026 年 12 月 31 日;2027 年 1 月 1 日起标准价翻倍。
| 模式 | 输入(至 2026-12-31) | 输出(至 2026-12-31) | 输入(2027-01-01 起) | 输出(2027-01-01 起) |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $1.50 | $7.50 |
| Batch / Flex | $0.375 | $1.875 | $0.75 | $3.75 |
| Priority | $1.35 | $6.75 | $2.70 | $13.50 |
三个容易漏算的点:
- 思考 token = 输出 token。 响应里的
thoughtsTokenCount要按 $3.75/M(导入期)进账单。高档位任务“看起来只回了 2K 字”,实际可能已经产出数万思考 token。 - 上下文缓存、Search / Maps grounding 另计。缓存有写入和存储费,2027 年也会调整;接地检索在免费额度用完后按请求收费。
- 3.7 Flash 仍然可用。 若延迟和 token 开销比正确率更重要,官方明确建议继续留在 3.7,或把 3.8 锁在
low。
粗算一个 Agent 编程会话:输入 80,000 token(仓库摘要 + 历史 + 工具回传),输出含思考 20,000 token。导入期 Standard 约 $0.06 + $0.075 = $0.135。同一会话如果走 GPT-6 Astra 标准价(≤272K 输入),大约是 $0.80 + $1.00 = $1.80,约 13 倍。这还没算 Astra 在超 272K 输入后整单涨价。
把订阅、超额 API 和云端 Mac 加在一起看月账单,可以对照 AI 编程一个月到底要花多少钱;多模型网关的加价规则见 OpenRouter API 价格对比。
API:模型 ID、Interactions 与 generateContent
3.8 Flash 可以走两条接口。新项目官方推荐 Interactions API(POST /v1beta/interactions);存量代码大多仍在 generateContent。两者都认同一个模型 ID。
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Summarize the failing test and propose a patch.",
"generation_config": { "thinking_level": "medium" }
}'
存量路径是 POST /v1beta/models/gemini-3.8-flash:generateContent。迁移时不要只改字符串:Interactions 用 previous_interaction_id 续跑,generateContent 则通常由你自己拼历史。工具循环、流式事件和 call_id 回传都要回归。
落地时建议固定四件事:
- 配置里写死
gemini-3.8-flash,不要依赖“最新 Flash”别名,避免静默换代。 - 按路由设置
thinking_level:客服草稿low,改仓库medium,数学 / 规划high。 - 日志同时记
usage和thoughtsTokenCount,否则月账单对不上。 - Structured Output 管最终 JSON,Function Calling 管中间动作,不要混成一套 Schema。
消费级入口在 Gemini app 和 Search AI Mode;生产 Agent 应走 Gemini API 或 Gemini Enterprise,并单独管理密钥、配额和数据保留。Interactions 的服务端状态有保留期限,审计日志仍要落在你自己的存储里。
和 GPT-6 Astra 怎么比
GPT-6 Astra 是 OpenAI 2026 年 9 月初放出的旗舰,面向“最难的端到端工作”:复杂推理、编程、Computer Use、研究和长文档。规格来自 OpenAI 模型页。
| 维度 | Gemini 3.8 Flash | GPT-6 Astra |
|---|---|---|
| 定位 | 最强 Flash 工作马 / Agent 默认模型 | 旗舰,最难任务 |
| 模型 ID | gemini-3.8-flash |
gpt-6-astra |
| 发布 | 2026-09-02(GA) | 2026-09-03 宣布,API 约 09-04 |
| 上下文 / 最大输出 | 约 1.05M / 64K–65K | 1,050,000 / 128,000 |
| 思考控制 | thinking_level:low / medium / high |
reasoning.effort:low–max(无 none) |
| 标准单价(≤ 长上下文门槛) | $0.75 / $3.75(导入期) | $10 / $50;缓存输入 $1,写入 $12.50 |
| 长上下文加价 | 公开表未单列 272K 门槛 | 输入 >272K:整单输入/缓存 2×、输出 1.5× |
| 主接口 | Interactions API + generateContent | Responses API(工具面更全) |
| 输入模态 | 文本 / 图 / 视频 / 音频 / PDF | 文本 + 图像 |
| 知识截止 | 多为 2026-03(部分 2025-01) | 2026-04-30 |
| DeepSWE v1.1 | 约 73.7%–73.8%(对照表) | 74.1%(OpenAI 自报) |
Astra 的工具面更偏“主机托管”:网页搜索、文件搜索、图像生成、Code Interpreter、托管 Shell、Apply Patch、Computer Use、Tool Search。3.8 Flash 的优势在多模态输入、导入价,以及和 Google 搜索 / 地图 / Workspace 的接地。Astra 在超长输入上还有整单涨价;把整仓或百万 token 卷宗一次性塞进去,单价会从 $10/$50 变成 $20/$75。
Batch / Flex 两边大约都是标准价的一半;Astra 另有 Fast(约 2×),Gemini 对应 Priority(约 1.8×)。比价时必须对齐同一服务等级,否则是在比较“便宜但可排队”和“贵但抢占”。
怎么选、怎么路由
不要把“最新旗舰”设成唯一默认。更稳的做法是按任务分级:
- 默认走 3.8 Flash
medium:日常改代码、工单、检索增强、大多数 Agent 循环。导入期内性价比最高。 - 延迟敏感走 3.8 Flash
low或留下 3.7 Flash:补全、分类、短回复。先看 p95,再看通过率。 - 难任务升级到 Astra 或 3.8 Flash
high:跨仓重构、Computer Use、长文档针尖检索、需要 128K 输出的报告。用影子流量对比通过率和美元,再切主路径。 - 2027 年预算要按 $1.50 / $7.50 重算。 导入价消失后,3.8 Flash 仍远低于 Astra,但不再是“几乎免费的前沿”。
Agent 真正的成本往往不在模型,而在执行环境:要在 Mac 上跑 Xcode、签名、模拟器和本地工具循环时,模型账单和机器账单必须分开算。Zilmac 云端 Mac 适合把稳定的 Apple 工具链留在固定节点,再通过 API 调用 3.8 Flash 或 Astra,避免把密钥、签名和 GPU 推理堆在同一台机器上。
常见问题
Gemini 3.8 Flash 和 Gemini 3.8 Pro 是一回事吗?
不是。3.8 Flash 是 Flash 档工作马,官方强调“与 3.7 同速同价、推理更强”。截至本文撰写(2026-09-08),公开 GA 主推的是 gemini-3.8-flash;不要把 Flash 的导入价套到尚未核对的 Pro 价目上。
3.8 Flash Cyber 能通过普通 Gemini API Key 调用吗?
不能按普通开发者配额理解。Cyber 走 Fairwind,面向受信任的防御方。普通生产和消费场景应使用 3.8 Flash。
从 3.7 Flash 升到 3.8 只要改模型名吗?
模型 ID 可以先改,但必须回归工具循环、Structured Output 和思考档位。3.8 可能多调工具、多花思考 token,延迟和账单都会变。先用 5%–10% 流量对比,再全量切换。
Gemini 3.8 Flash 和 GPT-6 Astra 谁更强?
没有统一答案。DeepSWE 上两者几乎打平,Astra 在部分综合智力指数和工具面上领先,3.8 Flash 在单价、多模态和导入窗口上领先。以你的回归集和美元/任务为准,而不是以发布会幻灯片为准。
一句话结论
- 3.8 Flash:2026 年秋季默认 Agent / 编程模型的高性价比选项,先锁
medium,盯紧思考 token。 - Astra:留给真正难、值得 $10/$50 的任务;注意 272K 门槛和缓存写入费。
- 2027-01-01:按翻倍后的 Flash 价重做预算,不要把导入价写进年度合同。
模型走 API,构建走云端 Mac
Gemini 3.8 Flash 和 GPT-6 Astra 解决的是推理;iOS / macOS 流水线仍然需要 Xcode、签名和稳定节点。Zilmac 云端 Mac 适合把 Agent 的执行环境固定下来。
模型和机器分开计费、分开扩缩。 — 查看云端 Mac 套餐