Gemini 3.8 Flash は Google が 2026 年 9 月 2 日に出した最新の Flash 級ワークホースです。長期間のソフトウェアエンジニアリング、自律 Agent、企業の多段階ワークフロー向けに位置づけられています。Gemini 3 シリーズの旗艦 Pro ではなく、最前線に近い推論とコーディング能力を、Flash の速度と導入価格に詰め込んだモデルです。入力 100万 token あたり $0.75、出力 $3.75。この価格は 2026 年 12 月 31 日まで有効です。
同じ週、OpenAI は旗艦 GPT-6 Astra(API モデル ID gpt-6-astra)を投入しました。標準価格は入力 100万 token あたり $10、出力 $50。どちらも Agent、コーディング、長コンテキストを前面に出しますが、請求額は桁が違います。本稿は Google 公式ブログ、Gemini API ドキュメント、DeepMind モデルカード、OpenAI モデルページに沿って、機能・性能・料金・API を分解し、現場で使える選定基準を示します。ベンダー自己申告のスコアを最終判断にはしません。
対象は次の 3 種類の読者です。デフォルトモデルを決める Agent / コーディングアシスタントのチーム。月次請求を見積もるプラットフォームと財務。Gemini Interactions API と OpenAI Responses API のあいだにアダプタ層を置くエンジニア。
- 3.8 Flash は GA の安定モデルです。ID は
gemini-3.8-flashで、preview 接尾辞はありません。 - 導入価格は 2026-12-31 まで。2027-01-01 以降の標準価格は $1.50 / $7.50 になります。
- 思考 token は出力として課金されます。レベルを上げると、単価が同じでも 1 タスクあたりの請求ははっきり増えることがあります。
Gemini 3.8 Flash とは
Google 公式の発表によると、3.8 は Gemini 3 ファミリーの 3 回目の Flash イテレーションで、3.7 Flash からおよそ 3 週間です。速度と導入価格は 3.7 と同じですが、ソフトウェアエンジニアリング、Agent タスク、専門領域の多段階推論は明確に強くなっています。公式は同時に 2 つのバリアントを出しています。
- Gemini 3.8 Flash:開発者と企業向けの汎用ワークホース。Gemini API、Google AI Studio、Gemini Enterprise、Antigravity、および Gemini app / Search AI Mode / Sheets(Google AI Pro または Ultra が必要)で使えます。
- Gemini 3.8 Flash Cyber:脆弱性発見と自動パッチ向けの防御モデル。Fairwind 計画を通じて、信頼できる政府、重要インフラ、ソフトウェアメンテナにだけ開放されます。本稿では公開利用できる Flash だけを扱い、非公開の防御インターフェースは扱いません。
DeepMind モデルカードでは、知識カットオフの多くは 2026 年 3 月、一部領域は 2025 年 1 月のままです(Gemini 3 ファミリーと同じ)。高努力レベルは遅くなりやすく、タイムアウトしやすく、token も多く消費します。遅延と請求を見積もるとき、これは端の話ではなく、最初から織り込む制約です。
Google は 3.8 Flash を Antigravity Agent と Antigravity SDK のデフォルトモデルにもしています。新規のホスト型 Agent プロジェクトは、設定を変えなければこれを呼びます。
機能:コンテキスト、思考レベル、組み込みツール
Gemini 最新モデルのドキュメントによると、公開能力は次の仕様表にまとめられます。
| 仕様 | Gemini 3.8 Flash |
|---|---|
| モデル ID | gemini-3.8-flash(安定 / GA) |
| 入力上限 | 1,048,576 token(約 1M) |
| 最大出力 | 65,536 token(ドキュメントでは 64K とも記載) |
| 思考レベル | low / medium(デフォルト)/ high;minimal はエラーになる |
| 入力モーダル | テキスト、画像、動画、音声、PDF |
| 出力モーダル | テキスト |
| 課金モード | Standard、Batch、Flex、Priority |
思考レベルの選び方
3.8 Flash でいちばん効くつまみは thinking_level であり、別モデル名に切り替えることではありません。公式の意図は次のように読めます。
- low:遅延に敏感な下書き、分類、簡単な書き換え。token コストは最も低い。
- medium(デフォルト):ほとんどの複雑なコードと Agent ループ。初回の正解率は通常こちらが良い。
- high:深い推論、数学、難しい多段階オーケストレーション。モデルは推論ステップとツール呼び出しを増やします。
Google 自身の言い方は、3.8 Flash は「より頑張る」(works harder)です。複雑なタスクではステップを増やし、ツールを繰り返し呼び、高レベルでは特に顕著です。第三者評価では、high の 1 タスクあたり出力 token が 3.7 Flash より 3 割前後多いことがあります。単価は同じでも、1 タスクのコストは上がります。本番のルーティングではタスク種別ごとにレベルを固定し、全体を high にしないでください。
組み込みツールと入力モーダル
3.8 Flash は Gemini 3 のツール面を継承します。コンテキストキャッシュ、コード実行、ファイル検索、Function Calling、Structured Output、Search grounding、Maps grounding、URL context。Computer Use はまだ Preview です。Agent にとっては、「モデル + ホスト型ツール」でまず通し、どの動作を自前関数に戻すかを後から決められます。
マルチモーダル入力は、デザインカンプ、エラー画面、会議録音、PDF 仕様を同じ Agent タスクにそのまま渡したいときに向きます。出力はテキストのままなので、業務システムへ渡す最終成果物は Structured Output か自前 Schema で検証してください。モデルが「ついでに」UI を描くことは期待しないでください。
まだ generateContent から Interactions API へ移行中なら、インターフェース層と状態層を先に分け、モデル名の差し替えは後です。移行順は 2026 年 Gemini API 更新後、Agent が先に直すべき層。
性能:公式ベンチマークと「より頑張る」コスト
Google は、3.8 Flash が複数の公開ベンチマークで、より高い旗艦モデルに並ぶ、あるいは上回ると強調しつつ、Flash 価格を維持しています。
- DeepSWE v1.1(長期間ソフトウェアエンジニアリング):公式は、より大きな最前線モデルの多くを上回ると主張します。第三者対照表では約 73.7%–73.8% がよく出ます。OpenAI の GPT-6 Astra 自己申告は 74.1%。同じ mini-swe-agent 枠では非常に近く、0.3 ポイントだけでは勝負は決まりません。
- HLE-Verified(学際的な多段階推論):公式数字は 54.9%。
- 専門 Agent:Vals Finance Agent V2、Harvey Legal Agent など。Google は 3.7 Flash や他の最前線モデルより良いと主張します。ベンダーが選んだシナリオなので、方向性のシグナルとして扱い、自リポジトリの回帰セットにはしないでください。
Artificial Analysis の Intelligence Index では GPT-6 Astra が一段上に置かれます(低思考レベルで約 57 vs 52。高レベル総合指数は 59–67 と報じられることが多く、定義は揃っていません)。エンジニアリングチームにとってより使える結論はこうです。コーディング Agent の通過率はすでに狭い帯に詰まっており、請求を分けるのは token 消費と単価です。
DeepSWE、HLE、GPQA は評価ハーネス、思考レベル、ツールのオンオフに依存します。リポジトリやタイムアウト方針を変えれば順位は動きます。本番前に自前の 20–50 件の回帰タスクで 3.7 Flash、3.8 Flash、Astra を並べ、通過率、thoughtsTokenCount、実時間、ドルコストを記録してください。
料金:導入期間、2027 年の値上げ、課金の落とし穴
下表は Google が公表した 3.8 Flash 単価です。単位はいずれも米ドル / 100万 token。導入期間は 2026 年 12 月 31 日まで。2027 年 1 月 1 日から標準価格は倍になります。
| モード | 入力(〜2026-12-31) | 出力(〜2026-12-31) | 入力(2027-01-01 以降) | 出力(2027-01-01 以降) |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $1.50 | $7.50 |
| Batch / Flex | $0.375 | $1.875 | $0.75 | $3.75 |
| Priority | $1.35 | $6.75 | $2.70 | $13.50 |
見落としやすい点が 3 つあります。
- 思考 token = 出力 token。 レスポンスの
thoughtsTokenCountは導入期間中 $3.75/M で請求に入ります。高レベルタスクは「見た目 2K 字しか返していない」ように見えても、思考 token はすでに数万出ていることがあります。 - コンテキストキャッシュ、Search / Maps grounding は別計です。キャッシュには書き込みと保管料があり、2027 年にも調整されます。グラウンディング検索は無料枠のあと、リクエスト単位で課金されます。
- 3.7 Flash は引き続き使えます。 遅延と token コストが正解率より大事なら、公式は 3.7 に残すか、3.8 を
lowに固定することを明確に勧めています。
粗い試算として、Agent のコーディングセッションを考えます。入力 80,000 token(リポジトリ要約 + 履歴 + ツール戻り値)、出力は思考込み 20,000 token。導入期間の Standard は約 $0.06 + $0.075 = $0.135。同じセッションを GPT-6 Astra 標準価格(入力 ≤272K)で走らせると約 $0.80 + $1.00 = $1.80、およそ 13 倍です。Astra が入力 272K 超で請求全体を上げる分は、まだ含んでいません。
サブスク、超過 API、クラウド Mac をまとめて月次請求を見るなら AI プログラミングの月額は結局いくらか。マルチモデルゲートウェイの上乗せルールは OpenRouter API 料金比較。
API:モデル ID、Interactions、generateContent
3.8 Flash は 2 本のインターフェースで呼べます。新規プロジェクトは公式が Interactions API(POST /v1beta/interactions)を推奨します。既存コードの多くはまだ generateContent です。どちらも同じモデル ID を認めます。
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Summarize the failing test and propose a patch.",
"generation_config": { "thinking_level": "medium" }
}'
既存経路は POST /v1beta/models/gemini-3.8-flash:generateContent。移行時は文字列だけ変えないでください。Interactions は previous_interaction_id で続きを走らせ、generateContent は通常あなたが履歴を組み立てます。ツールループ、ストリームイベント、call_id の返しは回帰してください。
本番では次の 4 点を固定することを勧めます。
- 設定に
gemini-3.8-flashを書き切り、「最新 Flash」エイリアスに頼らない。気づかない世代交代を避けるためです。 - ルートごとに
thinking_levelを設定。サポート下書きはlow、リポジトリ修正はmedium、数学 / 計画はhigh。 - ログは
usageとthoughtsTokenCountを同時に取る。そうしないと月次請求が合いません。 - Structured Output は最終 JSON、Function Calling は中間動作。1 つの Schema に混ぜない。
コンシューマ向け入口は Gemini app と Search AI Mode。本番 Agent は Gemini API か Gemini Enterprise を使い、鍵、クォータ、データ保持を別に管理してください。Interactions のサーバー側状態には保持期限があります。監査ログは自前ストレージに落としてください。
GPT-6 Astra との比較
GPT-6 Astra は OpenAI が 2026 年 9 月初旬に出した旗艦で、「最も難しいエンドツーエンド作業」向けです。複雑な推論、コーディング、Computer Use、調査、長文書。仕様は OpenAI モデルページからです。
| 項目 | Gemini 3.8 Flash | GPT-6 Astra |
|---|---|---|
| 位置づけ | 最上位 Flash ワークホース / Agent のデフォルトモデル | 旗艦、最難タスク |
| モデル ID | gemini-3.8-flash |
gpt-6-astra |
| リリース | 2026-09-02(GA) | 2026-09-03 発表、API は約 09-04 |
| コンテキスト / 最大出力 | 約 1.05M / 64K–65K | 1,050,000 / 128,000 |
| 思考制御 | thinking_level:low / medium / high |
reasoning.effort:low–max(none なし) |
| 標準単価(長コンテキストしきい値以下) | $0.75 / $3.75(導入期間) | $10 / $50;キャッシュ入力 $1、書き込み $12.50 |
| 長コンテキスト加算 | 公開表に 272K しきい値の単独列はない | 入力 >272K:請求全体の入力/キャッシュ 2×、出力 1.5× |
| 主インターフェース | Interactions API + generateContent | Responses API(ツール面がより厚い) |
| 入力モーダル | テキスト / 画像 / 動画 / 音声 / PDF | テキスト + 画像 |
| 知識カットオフ | 多くは 2026-03(一部 2025-01) | 2026-04-30 |
| DeepSWE v1.1 | 約 73.7%–73.8%(対照表) | 74.1%(OpenAI 自己申告) |
Astra のツール面は「ホスト管理」寄りです。ウェブ検索、ファイル検索、画像生成、Code Interpreter、ホスト型 Shell、Apply Patch、Computer Use、Tool Search。3.8 Flash の強みはマルチモーダル入力、導入価格、Google 検索 / 地図 / Workspace とのグラウンディングです。Astra は超長入力で請求全体が上がります。リポジトリ全体や 100万 token 級の一件を一度に入れると、単価は $10/$50 から $20/$75 になります。
Batch / Flex は双方とも標準価格のおよそ半分。Astra には Fast(約 2×)もあり、Gemini 側の対応は Priority(約 1.8×)です。比較するときは同じサービス等級に揃えてください。そうしないと「安いが待ち行列あり」と「高いが優先」を比べることになります。
選び方とルーティング
「最新旗艦」を唯一のデフォルトにしないでください。より安定するのは、タスクの段階分けです。
- デフォルトは 3.8 Flash
medium:日常のコード修正、チケット、検索拡張、大半の Agent ループ。導入期間中はコスパが最も高い。 - 遅延に敏感なら 3.8 Flash
low、または 3.7 Flash を残す:補完、分類、短い返信。先に p95、次に通過率。 - 難タスクは Astra か 3.8 Flash
highへ上げる:複数リポジトリにまたがるリファクタ、Computer Use、長文書のピンポイント検索、128K 出力が必要なレポート。シャドウトラフィックで通過率とドルを比べてから、主経路を切ります。 - 2027 年の予算は $1.50 / $7.50 で再計算。 導入価格がなくなっても 3.8 Flash は Astra よりかなり安いですが、「ほぼ無料の最前線」ではなくなります。
Agent の本当のコストは、モデルより実行環境に出ることが多いです。Mac 上で Xcode、署名、シミュレータ、ローカルツールループを回すなら、モデル請求とマシン請求は分けてください。Zilmac クラウド Mac は、安定した Apple ツールチェーンを固定ノードに残し、API で 3.8 Flash か Astra を呼ぶ向きです。鍵、署名、GPU 推論を同じマシンに積まないためです。
よくある質問
Gemini 3.8 Flash と Gemini 3.8 Pro は同じものですか?
違います。3.8 Flash は Flash 帯のワークホースで、公式は「3.7 と同じ速度・同じ価格で、推論はより強い」と強調しています。本稿執筆時点(2026-09-08)で、公開 GA の主力は gemini-3.8-flash です。Flash の導入価格を、未確認の Pro 価格表に当てはめないでください。
3.8 Flash Cyber は普通の Gemini API Key で呼べますか?
普通の開発者クォータとしては扱えません。Cyber は Fairwind 経由で、信頼できる防御側向けです。通常の本番とコンシューマ用途は 3.8 Flash を使ってください。
3.7 Flash から 3.8 へ上げるとき、モデル名だけ変えればよいですか?
モデル ID は先に変えてよいですが、ツールループ、Structured Output、思考レベルは回帰必須です。3.8 はツール呼び出しと思考 token を増やすことがあり、遅延と請求の両方に効きます。先に 5%–10% のトラフィックで比較し、それから全量切り替えしてください。
Gemini 3.8 Flash と GPT-6 Astra、どちらが強いですか?
一律の答えはありません。DeepSWE ではほぼ互角。Astra は一部の総合知力指数とツール面で先行し、3.8 Flash は単価、マルチモーダル、導入期間で先行します。発表スライドではなく、自前の回帰セットとドル/タスクで決めてください。
一言でまとめる
- 3.8 Flash:2026 年秋のデフォルト Agent / コーディングモデルとしてコスパが高い。まず
mediumに固定し、思考 token を監視する。 - Astra:本当に難しく、$10/$50 に見合うタスクへ。272K しきい値とキャッシュ書き込み料に注意。
- 2027-01-01:倍になった Flash 価格で予算を作り直す。導入価格を年間契約に書かない。
モデルは API、ビルドはクラウド Mac
Gemini 3.8 Flash と GPT-6 Astra が解くのは推論です。iOS / macOS パイプラインには、いまでも Xcode、署名、安定ノードが要ります。Zilmac クラウド Mac は、Agent の実行環境を固定するのに向きます。
モデルとマシンは別請求、別スケール。 — クラウド Mac プランを見る