Zilmac ブログ
← 技術実践に戻る

Gemini 3.8 Flash とは?機能・性能・料金・API と GPT-6 Astra 比較(2026)

API と Agent ·約 14 分

開発者がマルチ画面ワークステーションでコードをデバッグする様子。Gemini 3.8 Flash API と Agent プログラミングのワークフローを示す
$0.75 / $3.75
3.8 Flash 導入価格(100万 token あたり、2026-12-31 まで)
1M / 64K
コンテキストウィンドウ / 最大出力
約 13×
同クラスの token 単価は GPT-6 Astra より安い

Gemini 3.8 Flash は Google が 2026 年 9 月 2 日に出した最新の Flash 級ワークホースです。長期間のソフトウェアエンジニアリング、自律 Agent、企業の多段階ワークフロー向けに位置づけられています。Gemini 3 シリーズの旗艦 Pro ではなく、最前線に近い推論とコーディング能力を、Flash の速度と導入価格に詰め込んだモデルです。入力 100万 token あたり $0.75、出力 $3.75。この価格は 2026 年 12 月 31 日まで有効です。

同じ週、OpenAI は旗艦 GPT-6 Astra(API モデル ID gpt-6-astra)を投入しました。標準価格は入力 100万 token あたり $10、出力 $50。どちらも Agent、コーディング、長コンテキストを前面に出しますが、請求額は桁が違います。本稿は Google 公式ブログ、Gemini API ドキュメント、DeepMind モデルカード、OpenAI モデルページに沿って、機能・性能・料金・API を分解し、現場で使える選定基準を示します。ベンダー自己申告のスコアを最終判断にはしません。

対象は次の 3 種類の読者です。デフォルトモデルを決める Agent / コーディングアシスタントのチーム。月次請求を見積もるプラットフォームと財務。Gemini Interactions API と OpenAI Responses API のあいだにアダプタ層を置くエンジニア。

先に 3 点だけ押さえる
  • 3.8 Flash は GA の安定モデルです。ID は gemini-3.8-flash で、preview 接尾辞はありません。
  • 導入価格は 2026-12-31 まで。2027-01-01 以降の標準価格は $1.50 / $7.50 になります。
  • 思考 token は出力として課金されます。レベルを上げると、単価が同じでも 1 タスクあたりの請求ははっきり増えることがあります。

Gemini 3.8 Flash とは

Google 公式の発表によると、3.8 は Gemini 3 ファミリーの 3 回目の Flash イテレーションで、3.7 Flash からおよそ 3 週間です。速度と導入価格は 3.7 と同じですが、ソフトウェアエンジニアリング、Agent タスク、専門領域の多段階推論は明確に強くなっています。公式は同時に 2 つのバリアントを出しています。

  • Gemini 3.8 Flash:開発者と企業向けの汎用ワークホース。Gemini API、Google AI Studio、Gemini Enterprise、Antigravity、および Gemini app / Search AI Mode / Sheets(Google AI Pro または Ultra が必要)で使えます。
  • Gemini 3.8 Flash Cyber:脆弱性発見と自動パッチ向けの防御モデル。Fairwind 計画を通じて、信頼できる政府、重要インフラ、ソフトウェアメンテナにだけ開放されます。本稿では公開利用できる Flash だけを扱い、非公開の防御インターフェースは扱いません。

DeepMind モデルカードでは、知識カットオフの多くは 2026 年 3 月、一部領域は 2025 年 1 月のままです(Gemini 3 ファミリーと同じ)。高努力レベルは遅くなりやすく、タイムアウトしやすく、token も多く消費します。遅延と請求を見積もるとき、これは端の話ではなく、最初から織り込む制約です。

Google は 3.8 Flash を Antigravity Agent と Antigravity SDK のデフォルトモデルにもしています。新規のホスト型 Agent プロジェクトは、設定を変えなければこれを呼びます。

機能:コンテキスト、思考レベル、組み込みツール

Gemini 最新モデルのドキュメントによると、公開能力は次の仕様表にまとめられます。

仕様 Gemini 3.8 Flash
モデル ID gemini-3.8-flash(安定 / GA)
入力上限 1,048,576 token(約 1M)
最大出力 65,536 token(ドキュメントでは 64K とも記載)
思考レベル low / medium(デフォルト)/ high;minimal はエラーになる
入力モーダル テキスト、画像、動画、音声、PDF
出力モーダル テキスト
課金モード Standard、Batch、Flex、Priority

思考レベルの選び方

3.8 Flash でいちばん効くつまみは thinking_level であり、別モデル名に切り替えることではありません。公式の意図は次のように読めます。

  • low:遅延に敏感な下書き、分類、簡単な書き換え。token コストは最も低い。
  • medium(デフォルト):ほとんどの複雑なコードと Agent ループ。初回の正解率は通常こちらが良い。
  • high:深い推論、数学、難しい多段階オーケストレーション。モデルは推論ステップとツール呼び出しを増やします。

Google 自身の言い方は、3.8 Flash は「より頑張る」(works harder)です。複雑なタスクではステップを増やし、ツールを繰り返し呼び、高レベルでは特に顕著です。第三者評価では、high の 1 タスクあたり出力 token が 3.7 Flash より 3 割前後多いことがあります。単価は同じでも、1 タスクのコストは上がります。本番のルーティングではタスク種別ごとにレベルを固定し、全体を high にしないでください。

組み込みツールと入力モーダル

3.8 Flash は Gemini 3 のツール面を継承します。コンテキストキャッシュ、コード実行、ファイル検索、Function Calling、Structured Output、Search grounding、Maps grounding、URL context。Computer Use はまだ Preview です。Agent にとっては、「モデル + ホスト型ツール」でまず通し、どの動作を自前関数に戻すかを後から決められます。

マルチモーダル入力は、デザインカンプ、エラー画面、会議録音、PDF 仕様を同じ Agent タスクにそのまま渡したいときに向きます。出力はテキストのままなので、業務システムへ渡す最終成果物は Structured Output か自前 Schema で検証してください。モデルが「ついでに」UI を描くことは期待しないでください。

まだ generateContent から Interactions API へ移行中なら、インターフェース層と状態層を先に分け、モデル名の差し替えは後です。移行順は 2026 年 Gemini API 更新後、Agent が先に直すべき層。

性能:公式ベンチマークと「より頑張る」コスト

Google は、3.8 Flash が複数の公開ベンチマークで、より高い旗艦モデルに並ぶ、あるいは上回ると強調しつつ、Flash 価格を維持しています。

  • DeepSWE v1.1(長期間ソフトウェアエンジニアリング):公式は、より大きな最前線モデルの多くを上回ると主張します。第三者対照表では約 73.7%–73.8% がよく出ます。OpenAI の GPT-6 Astra 自己申告は 74.1%。同じ mini-swe-agent 枠では非常に近く、0.3 ポイントだけでは勝負は決まりません。
  • HLE-Verified(学際的な多段階推論):公式数字は 54.9%。
  • 専門 Agent:Vals Finance Agent V2、Harvey Legal Agent など。Google は 3.7 Flash や他の最前線モデルより良いと主張します。ベンダーが選んだシナリオなので、方向性のシグナルとして扱い、自リポジトリの回帰セットにはしないでください。

Artificial Analysis の Intelligence Index では GPT-6 Astra が一段上に置かれます(低思考レベルで約 57 vs 52。高レベル総合指数は 59–67 と報じられることが多く、定義は揃っていません)。エンジニアリングチームにとってより使える結論はこうです。コーディング Agent の通過率はすでに狭い帯に詰まっており、請求を分けるのは token 消費と単価です。

開発者がコードエディタで Gemini API と Agent ワークフローをデバッグしている
3.8 Flash の性能差は、リポジトリを多段階で直し、ツールを繰り返し呼ぶ長タスクに出やすく、1 往復の Q&A には出にくいです。
ベンチマーク順位をそのまま SLA に書かない

DeepSWE、HLE、GPQA は評価ハーネス、思考レベル、ツールのオンオフに依存します。リポジトリやタイムアウト方針を変えれば順位は動きます。本番前に自前の 20–50 件の回帰タスクで 3.7 Flash、3.8 Flash、Astra を並べ、通過率、thoughtsTokenCount、実時間、ドルコストを記録してください。

料金:導入期間、2027 年の値上げ、課金の落とし穴

下表は Google が公表した 3.8 Flash 単価です。単位はいずれも米ドル / 100万 token。導入期間は 2026 年 12 月 31 日まで。2027 年 1 月 1 日から標準価格は倍になります。

モード 入力(〜2026-12-31) 出力(〜2026-12-31) 入力(2027-01-01 以降) 出力(2027-01-01 以降)
Standard $0.75 $3.75 $1.50 $7.50
Batch / Flex $0.375 $1.875 $0.75 $3.75
Priority $1.35 $6.75 $2.70 $13.50

見落としやすい点が 3 つあります。

  1. 思考 token = 出力 token。 レスポンスの thoughtsTokenCount は導入期間中 $3.75/M で請求に入ります。高レベルタスクは「見た目 2K 字しか返していない」ように見えても、思考 token はすでに数万出ていることがあります。
  2. コンテキストキャッシュ、Search / Maps grounding は別計です。キャッシュには書き込みと保管料があり、2027 年にも調整されます。グラウンディング検索は無料枠のあと、リクエスト単位で課金されます。
  3. 3.7 Flash は引き続き使えます。 遅延と token コストが正解率より大事なら、公式は 3.7 に残すか、3.8 を low に固定することを明確に勧めています。

粗い試算として、Agent のコーディングセッションを考えます。入力 80,000 token(リポジトリ要約 + 履歴 + ツール戻り値)、出力は思考込み 20,000 token。導入期間の Standard は約 $0.06 + $0.075 = $0.135。同じセッションを GPT-6 Astra 標準価格(入力 ≤272K)で走らせると約 $0.80 + $1.00 = $1.80、およそ 13 倍です。Astra が入力 272K 超で請求全体を上げる分は、まだ含んでいません。

サブスク、超過 API、クラウド Mac をまとめて月次請求を見るなら AI プログラミングの月額は結局いくらか。マルチモデルゲートウェイの上乗せルールは OpenRouter API 料金比較。

API:モデル ID、Interactions、generateContent

3.8 Flash は 2 本のインターフェースで呼べます。新規プロジェクトは公式が Interactions API(POST /v1beta/interactions)を推奨します。既存コードの多くはまだ generateContent です。どちらも同じモデル ID を認めます。

Interactions API(例)
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "input": "Summarize the failing test and propose a patch.",
    "generation_config": { "thinking_level": "medium" }
  }'

既存経路は POST /v1beta/models/gemini-3.8-flash:generateContent。移行時は文字列だけ変えないでください。Interactions は previous_interaction_id で続きを走らせ、generateContent は通常あなたが履歴を組み立てます。ツールループ、ストリームイベント、call_id の返しは回帰してください。

本番では次の 4 点を固定することを勧めます。

  • 設定に gemini-3.8-flash を書き切り、「最新 Flash」エイリアスに頼らない。気づかない世代交代を避けるためです。
  • ルートごとに thinking_level を設定。サポート下書きは low、リポジトリ修正は medium、数学 / 計画は high。
  • ログは usage と thoughtsTokenCount を同時に取る。そうしないと月次請求が合いません。
  • Structured Output は最終 JSON、Function Calling は中間動作。1 つの Schema に混ぜない。

コンシューマ向け入口は Gemini app と Search AI Mode。本番 Agent は Gemini API か Gemini Enterprise を使い、鍵、クォータ、データ保持を別に管理してください。Interactions のサーバー側状態には保持期限があります。監査ログは自前ストレージに落としてください。

GPT-6 Astra との比較

GPT-6 Astra は OpenAI が 2026 年 9 月初旬に出した旗艦で、「最も難しいエンドツーエンド作業」向けです。複雑な推論、コーディング、Computer Use、調査、長文書。仕様は OpenAI モデルページからです。

項目 Gemini 3.8 Flash GPT-6 Astra
位置づけ 最上位 Flash ワークホース / Agent のデフォルトモデル 旗艦、最難タスク
モデル ID gemini-3.8-flash gpt-6-astra
リリース 2026-09-02(GA) 2026-09-03 発表、API は約 09-04
コンテキスト / 最大出力 約 1.05M / 64K–65K 1,050,000 / 128,000
思考制御 thinking_level:low / medium / high reasoning.effort:low–max(none なし)
標準単価(長コンテキストしきい値以下) $0.75 / $3.75(導入期間) $10 / $50;キャッシュ入力 $1、書き込み $12.50
長コンテキスト加算 公開表に 272K しきい値の単独列はない 入力 >272K:請求全体の入力/キャッシュ 2×、出力 1.5×
主インターフェース Interactions API + generateContent Responses API(ツール面がより厚い)
入力モーダル テキスト / 画像 / 動画 / 音声 / PDF テキスト + 画像
知識カットオフ 多くは 2026-03(一部 2025-01) 2026-04-30
DeepSWE v1.1 約 73.7%–73.8%(対照表) 74.1%(OpenAI 自己申告)

Astra のツール面は「ホスト管理」寄りです。ウェブ検索、ファイル検索、画像生成、Code Interpreter、ホスト型 Shell、Apply Patch、Computer Use、Tool Search。3.8 Flash の強みはマルチモーダル入力、導入価格、Google 検索 / 地図 / Workspace とのグラウンディングです。Astra は超長入力で請求全体が上がります。リポジトリ全体や 100万 token 級の一件を一度に入れると、単価は $10/$50 から $20/$75 になります。

Batch / Flex は双方とも標準価格のおよそ半分。Astra には Fast(約 2×)もあり、Gemini 側の対応は Priority(約 1.8×)です。比較するときは同じサービス等級に揃えてください。そうしないと「安いが待ち行列あり」と「高いが優先」を比べることになります。

選び方とルーティング

「最新旗艦」を唯一のデフォルトにしないでください。より安定するのは、タスクの段階分けです。

  • デフォルトは 3.8 Flash medium:日常のコード修正、チケット、検索拡張、大半の Agent ループ。導入期間中はコスパが最も高い。
  • 遅延に敏感なら 3.8 Flash low、または 3.7 Flash を残す:補完、分類、短い返信。先に p95、次に通過率。
  • 難タスクは Astra か 3.8 Flash high へ上げる:複数リポジトリにまたがるリファクタ、Computer Use、長文書のピンポイント検索、128K 出力が必要なレポート。シャドウトラフィックで通過率とドルを比べてから、主経路を切ります。
  • 2027 年の予算は $1.50 / $7.50 で再計算。 導入価格がなくなっても 3.8 Flash は Astra よりかなり安いですが、「ほぼ無料の最前線」ではなくなります。

Agent の本当のコストは、モデルより実行環境に出ることが多いです。Mac 上で Xcode、署名、シミュレータ、ローカルツールループを回すなら、モデル請求とマシン請求は分けてください。Zilmac クラウド Mac は、安定した Apple ツールチェーンを固定ノードに残し、API で 3.8 Flash か Astra を呼ぶ向きです。鍵、署名、GPU 推論を同じマシンに積まないためです。

よくある質問

Gemini 3.8 Flash と Gemini 3.8 Pro は同じものですか?

違います。3.8 Flash は Flash 帯のワークホースで、公式は「3.7 と同じ速度・同じ価格で、推論はより強い」と強調しています。本稿執筆時点(2026-09-08)で、公開 GA の主力は gemini-3.8-flash です。Flash の導入価格を、未確認の Pro 価格表に当てはめないでください。

3.8 Flash Cyber は普通の Gemini API Key で呼べますか?

普通の開発者クォータとしては扱えません。Cyber は Fairwind 経由で、信頼できる防御側向けです。通常の本番とコンシューマ用途は 3.8 Flash を使ってください。

3.7 Flash から 3.8 へ上げるとき、モデル名だけ変えればよいですか?

モデル ID は先に変えてよいですが、ツールループ、Structured Output、思考レベルは回帰必須です。3.8 はツール呼び出しと思考 token を増やすことがあり、遅延と請求の両方に効きます。先に 5%–10% のトラフィックで比較し、それから全量切り替えしてください。

Gemini 3.8 Flash と GPT-6 Astra、どちらが強いですか?

一律の答えはありません。DeepSWE ではほぼ互角。Astra は一部の総合知力指数とツール面で先行し、3.8 Flash は単価、マルチモーダル、導入期間で先行します。発表スライドではなく、自前の回帰セットとドル/タスクで決めてください。

一言でまとめる

  • 3.8 Flash:2026 年秋のデフォルト Agent / コーディングモデルとしてコスパが高い。まず medium に固定し、思考 token を監視する。
  • Astra:本当に難しく、$10/$50 に見合うタスクへ。272K しきい値とキャッシュ書き込み料に注意。
  • 2027-01-01:倍になった Flash 価格で予算を作り直す。導入価格を年間契約に書かない。

モデルは API、ビルドはクラウド Mac

Gemini 3.8 Flash と GPT-6 Astra が解くのは推論です。iOS / macOS パイプラインには、いまでも Xcode、署名、安定ノードが要ります。Zilmac クラウド Mac は、Agent の実行環境を固定するのに向きます。

モデルとマシンは別請求、別スケール。 — クラウド Mac プランを見る

期間限定

Zilmac

クラウド Mac、リモート開発、Mac VPS。iOS とクロスプラットフォームのチームに Apple ツールチェーンを足す。

ホームに戻る
期間限定 プランを見る