Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日發布的最新 Flash 級工作馬模型,定位長程軟體工程、自主 Agent 和企業多步工作流程。它不是 Gemini 3 系列的旗艦 Pro,而是把接近前沿的推理與程式能力,壓進 Flash 的速度和導入價:每百萬輸入 token $0.75、輸出 $3.75,有效期限到 2026 年 12 月 31 日。
同一週,OpenAI 推出旗艦 GPT-6 Astra(API 模型 ID gpt-6-astra),標準價是每百萬輸入 $10、輸出 $50。兩邊都主打 Agent、程式設計和長上下文,但帳單差了一個數量級。本文依 Google 官方部落格、Gemini API 文件、DeepMind 模型卡和 OpenAI 模型頁,拆功能、效能、價格與 API,並給出可落地的選型,不把廠商自報分數當成最終驗收。
適合三類讀者:要決定預設模型的 Agent / 程式設計助手團隊;要估算月帳單的平台與財務;要在 Gemini Interactions API 和 OpenAI Responses API 之間做適配層的工程師。
- 3.8 Flash 是 GA 穩定模型,ID 就是
gemini-3.8-flash,沒有 preview 後綴。 - 導入價只到 2026-12-31;2027-01-01 起標準價變為 $1.50 / $7.50。
- 思考 token 按輸出計費。檔位越高,單次任務帳單可能明顯上升,即使單價沒變。
Gemini 3.8 Flash 是什麼
依 Google 官方發布說明,3.8 是 Gemini 3 家族的第三次 Flash 迭代,距離 3.7 Flash 大約三週。它和 3.7 同速、同導入價,但在軟體工程、Agent 任務和專業領域多步推理上明顯加強。官方同時推出兩個變體:
- Gemini 3.8 Flash:面向開發者和企業的通用工作馬,走 Gemini API、Google AI Studio、Gemini Enterprise、Antigravity,以及 Gemini app / Search AI Mode / Sheets(需 Google AI Pro 或 Ultra)。
- Gemini 3.8 Flash Cyber:面向漏洞發現與自動修補的防禦向模型,只透過 Fairwind 計畫向受信任的政府、關鍵基礎設施和軟體維護方開放。本文只討論公開可用的 Flash,不展開未公開的防禦介面。
DeepMind 模型卡寫明:知識截止日期多為 2026 年 3 月,部分領域仍停留在 2025 年 1 月(與 Gemini 3 家族一致)。高努力檔位可能更慢、更容易逾時,也會消耗更多 token。這些不是邊角料,而是估算延遲和帳單時必須算進去的約束。
Google 還把 3.8 Flash 設為 Antigravity Agent 與 Antigravity SDK 的預設模型。新開的託管 Agent 專案,若未改設定,呼叫的就是它。
功能:上下文、思考檔位與內建工具
依 Gemini 最新模型文件,公開能力可以壓成一張規格表:
| 規格 | Gemini 3.8 Flash |
|---|---|
| 模型 ID | gemini-3.8-flash(穩定 / GA) |
| 輸入上限 | 1,048,576 token(約 1M) |
| 最大輸出 | 65,536 token(文件亦寫作 64K) |
| 思考檔位 | low / medium(預設)/ high;minimal 會報錯 |
| 輸入模態 | 文字、圖片、影片、音訊、PDF |
| 輸出模態 | 文字 |
| 計費模式 | Standard、Batch、Flex、Priority |
思考檔位怎麼選
3.8 Flash 的核心旋鈕是 thinking_level,不是再換一個模型名稱。官方建議可以這樣理解:
- low:延遲敏感、草稿、分類、簡單改寫。token 開銷最低。
- medium(預設):大多數複雜程式碼和 Agent 迴圈。首輪正確率通常更好。
- high:深推理、數學、難的多步編排。模型會多走推理步驟、多呼叫工具。
Google 自己的表述是:3.8 Flash「更賣力」(works harder)。複雜任務上它會多走幾步、反覆呼叫工具,高檔位尤其明顯。獨立評測裡,high 的單次任務輸出 token 可能比 3.7 Flash 高三成左右——單價沒變,單次任務成本照樣漲。正式環境路由應依任務類型鎖定檔位,不要全域 high。
內建工具與輸入模態
3.8 Flash 繼承 Gemini 3 的工具面:上下文快取、程式碼執行、檔案搜尋、Function Calling、Structured Output、Search grounding、Maps grounding、URL context;Computer Use 仍是 Preview。對 Agent 來說,這意味著「模型 + 託管工具」可以先跑通,再決定哪些動作必須回到你自己的函式。
多模態輸入適合:把設計稿、錯誤截圖、會議錄音或 PDF 規範直接塞進同一條 Agent 任務。輸出仍是文字,所以最終交付給業務系統時,仍要用 Structured Output 或你自己的 Schema 驗證,而不是指望模型「順便」畫出介面。
若你還在從 generateContent 遷移到 Interactions API,介面層與狀態層應先拆開,再換模型名稱。遷移順序見 2026 Gemini API 更新後 Agent 先改哪一層。
效能:官方基準與「更賣力」的代價
Google 強調 3.8 Flash 在多個公開基準上接近甚至超過更貴的前沿模型,同時維持 Flash 價:
- DeepSWE v1.1(長程軟體工程):官方稱優於多數更大的前沿模型;第三方對照表常見分數約 73.7%–73.8%。OpenAI 給 GPT-6 Astra 的自報是 74.1%。兩者在同一套 mini-swe-agent 框架上非常接近,不能單憑 0.3 個百分點定勝負。
- HLE-Verified(跨學科多步推理):官方數字 54.9%。
- 專業 Agent:Vals Finance Agent V2、Harvey Legal Agent 等,Google 稱優於 3.7 Flash 和其他前沿模型。這些是廠商選定場景,應當作方向訊號,不是你儲存庫裡的迴歸集。
Artificial Analysis 的 Intelligence Index 把 GPT-6 Astra 放在更高一檔(低思考檔約 57 vs 52;高檔綜合指數常見報導在 59–67,口徑並不統一)。對工程團隊更有用的結論是:程式設計 Agent 的通過率已經擠在同一條窄帶上,真正拉開帳單的是 token 消耗和單價。
DeepSWE、HLE、GPQA 都依賴評測鷹架、思考檔位和工具開關。換一套儲存庫、換一種逾時策略,名次就會動。上線前用自己的 20–50 條迴歸任務對比 3.7 Flash、3.8 Flash 和 Astra,記錄通過率、thoughtsTokenCount、實際經過時間和美元成本。
價格:導入期、2027 漲價與計費陷阱
下表依 Google 公布的 3.8 Flash 單價整理,單位均為美元 / 百萬 token。導入期到 2026 年 12 月 31 日;2027 年 1 月 1 日起標準價翻倍。
| 模式 | 輸入(至 2026-12-31) | 輸出(至 2026-12-31) | 輸入(2027-01-01 起) | 輸出(2027-01-01 起) |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $1.50 | $7.50 |
| Batch / Flex | $0.375 | $1.875 | $0.75 | $3.75 |
| Priority | $1.35 | $6.75 | $2.70 | $13.50 |
三個容易漏算的點:
- 思考 token = 輸出 token。 回應裡的
thoughtsTokenCount要按 $3.75/M(導入期)計入帳單。高檔位任務「看起來只回了 2K 字」,實際可能已經產出數萬思考 token。 - 上下文快取、Search / Maps grounding 另計。快取有寫入和儲存費,2027 年也會調整;接地檢索在免費額度用完後依請求收費。
- 3.7 Flash 仍然可用。 若延遲和 token 開銷比正確率更重要,官方明確建議繼續留在 3.7,或把 3.8 鎖在
low。
粗估一個 Agent 程式設計工作階段:輸入 80,000 token(儲存庫摘要 + 歷史 + 工具回傳),輸出含思考 20,000 token。導入期 Standard 約 $0.06 + $0.075 = $0.135。同一工作階段如果走 GPT-6 Astra 標準價(≤272K 輸入),大約是 $0.80 + $1.00 = $1.80,約 13 倍。這還沒算 Astra 在超過 272K 輸入後整單漲價。
把訂閱、超額 API 和雲端 Mac 加在一起看月帳單,可以對照 AI 程式設計一個月到底要花多少錢;多模型閘道的加價規則見 OpenRouter API 價格對比。
API:模型 ID、Interactions 與 generateContent
3.8 Flash 可以走兩條介面。新專案官方建議 Interactions API(POST /v1beta/interactions);既有程式碼大多仍在 generateContent。兩者都認同同一個模型 ID。
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Summarize the failing test and propose a patch.",
"generation_config": { "thinking_level": "medium" }
}'
既有路徑是 POST /v1beta/models/gemini-3.8-flash:generateContent。遷移時不要只改字串:Interactions 用 previous_interaction_id 續跑,generateContent 則通常由你自己拼歷史。工具迴圈、串流事件和 call_id 回傳都要迴歸。
落地時建議固定四件事:
- 設定裡寫死
gemini-3.8-flash,不要依賴「最新 Flash」別名,避免靜默換代。 - 依路由設定
thinking_level:客服草稿low,改儲存庫medium,數學 / 規劃high。 - 日誌同時記
usage和thoughtsTokenCount,否則月帳單對不上。 - Structured Output 管最終 JSON,Function Calling 管中間動作,不要混成一套 Schema。
消費級入口在 Gemini app 和 Search AI Mode;正式環境 Agent 應走 Gemini API 或 Gemini Enterprise,並單獨管理金鑰、配額和資料保留。Interactions 的伺服器端狀態有保留期限,稽核日誌仍要落在你自己的儲存裡。
和 GPT-6 Astra 怎麼比
GPT-6 Astra 是 OpenAI 2026 年 9 月初推出的旗艦,面向「最難的端對端工作」:複雜推理、程式設計、Computer Use、研究和長文件。規格來自 OpenAI 模型頁。
| 維度 | Gemini 3.8 Flash | GPT-6 Astra |
|---|---|---|
| 定位 | 最強 Flash 工作馬 / Agent 預設模型 | 旗艦,最難任務 |
| 模型 ID | gemini-3.8-flash |
gpt-6-astra |
| 發布 | 2026-09-02(GA) | 2026-09-03 宣布,API 約 09-04 |
| 上下文 / 最大輸出 | 約 1.05M / 64K–65K | 1,050,000 / 128,000 |
| 思考控制 | thinking_level:low / medium / high |
reasoning.effort:low–max(無 none) |
| 標準單價(≤ 長上下文門檻) | $0.75 / $3.75(導入期) | $10 / $50;快取輸入 $1,寫入 $12.50 |
| 長上下文加價 | 公開表未單列 272K 門檻 | 輸入 >272K:整單輸入/快取 2×、輸出 1.5× |
| 主介面 | Interactions API + generateContent | Responses API(工具面更完整) |
| 輸入模態 | 文字 / 圖 / 影片 / 音訊 / PDF | 文字 + 圖像 |
| 知識截止 | 多為 2026-03(部分 2025-01) | 2026-04-30 |
| DeepSWE v1.1 | 約 73.7%–73.8%(對照表) | 74.1%(OpenAI 自報) |
Astra 的工具面更偏「主機託管」:網頁搜尋、檔案搜尋、圖像生成、Code Interpreter、託管 Shell、Apply Patch、Computer Use、Tool Search。3.8 Flash 的優勢在多模態輸入、導入價,以及和 Google 搜尋 / 地圖 / Workspace 的接地。Astra 在超長輸入上還有整單漲價;把整個儲存庫或百萬 token 卷宗一次性塞進去,單價會從 $10/$50 變成 $20/$75。
Batch / Flex 兩邊大約都是標準價的一半;Astra 另有 Fast(約 2×),Gemini 對應 Priority(約 1.8×)。比價時必須對齊同一服務等級,否則是在比較「便宜但可排隊」和「貴但搶佔」。
怎麼選、怎麼路由
不要把「最新旗艦」設成唯一預設。更穩的做法是依任務分級:
- 預設走 3.8 Flash
medium:日常改程式碼、工單、檢索增強、大多數 Agent 迴圈。導入期內性價比最高。 - 延遲敏感走 3.8 Flash
low或留下 3.7 Flash:補全、分類、短回覆。先看 p95,再看通過率。 - 難任務升級到 Astra 或 3.8 Flash
high:跨儲存庫重構、Computer Use、長文件精準檢索、需要 128K 輸出的報告。用影子流量對比通過率和美元,再切主路徑。 - 2027 年預算要依 $1.50 / $7.50 重算。 導入價消失後,3.8 Flash 仍遠低於 Astra,但不再是「幾乎免費的前沿」。
Agent 真正的成本往往不在模型,而在執行環境:要在 Mac 上跑 Xcode、簽署、模擬器和本機工具迴圈時,模型帳單和機器帳單必須分開算。Zilmac 雲端 Mac 適合把穩定的 Apple 工具鏈留在固定節點,再透過 API 呼叫 3.8 Flash 或 Astra,避免把金鑰、簽署和 GPU 推理堆在同一台機器上。
常見問題
Gemini 3.8 Flash 和 Gemini 3.8 Pro 是同一件事嗎?
不是。3.8 Flash 是 Flash 檔工作馬,官方強調「與 3.7 同速同價、推理更強」。截至本文撰寫(2026-09-08),公開 GA 主推的是 gemini-3.8-flash;不要把 Flash 的導入價套到尚未核對的 Pro 價目上。
3.8 Flash Cyber 能透過一般 Gemini API Key 呼叫嗎?
不能依一般開發者配額理解。Cyber 走 Fairwind,面向受信任的防禦方。一般正式與消費場景應使用 3.8 Flash。
從 3.7 Flash 升到 3.8 只要改模型名稱嗎?
模型 ID 可以先改,但必須迴歸工具迴圈、Structured Output 和思考檔位。3.8 可能多呼叫工具、多花思考 token,延遲和帳單都會變。先用 5%–10% 流量對比,再全量切換。
Gemini 3.8 Flash 和 GPT-6 Astra 誰更強?
沒有統一答案。DeepSWE 上兩者幾乎打平,Astra 在部分綜合智力指數和工具面上領先,3.8 Flash 在單價、多模態和導入視窗上領先。以你的迴歸集和美元/任務為準,而不是以發表會投影片為準。
一句話結論
- 3.8 Flash:2026 年秋季預設 Agent / 程式設計模型的高性價比選項,先鎖
medium,盯緊思考 token。 - Astra:留給真正難、值得 $10/$50 的任務;注意 272K 門檻和快取寫入費。
- 2027-01-01:依翻倍後的 Flash 價重做預算,不要把導入價寫進年度合約。
模型走 API,建置走雲端 Mac
Gemini 3.8 Flash 和 GPT-6 Astra 解決的是推理;iOS / macOS 流水線仍然需要 Xcode、簽署和穩定節點。Zilmac 雲端 Mac 適合把 Agent 的執行環境固定下來。
模型和機器分開計費、分開擴縮。 — 查看雲端 Mac 套餐