Zilmac Блог
← Назад к технической практике

Что такое Gemini 3.8 Flash? Функции, производительность, цены, API и сравнение с GPT-6 Astra (2026)

API и Agents ·~14 мин чтения

Разработчик отлаживает код на мультимониторной станции — Gemini 3.8 Flash API и рабочие циклы Agent
$0.75 / $3.75
Стартовая цена 3.8 Flash (за миллион token, на 2026-12-31)
1M / 64K
Контекстное окно / макс. выход
≈ 13×
Ставка token в том же классе ниже, чем у GPT-6 Astra

Gemini 3.8 Flash — свежая рабочая лошадка класса Flash от Google, вышедшая 2 сентября 2026 года. Ниша — длинные инженерные задачи, автономные Agent и многошаговые корпоративные пайплайны. Это не флагманский Pro линейки Gemini 3, а почти передовой reasoning и код, уложенные в скорость и стартовую цену Flash: $0.75 за миллион входных token и $3.75 за выход — до 31 декабря 2026.

В ту же неделю OpenAI выкатил флагман GPT-6 Astra (API model ID gpt-6-astra) со стандартной ценой $10 / $50 за миллион вход / выход. Оба бьют в Agent, код и длинный контекст, но счета расходятся на порядок. Ниже — функции, производительность, цены и API по официальному блогу Google, документации Gemini API, карточке модели DeepMind и странице модели OpenAI. Самооценки вендоров — ориентир, не приёмка.

Текст для трёх аудиторий: команд Agent / ассистентов, которым нужен дефолт; платформ и финансов, которые считают месячный счёт; инженеров, которые пишут адаптер между Gemini Interactions API и OpenAI Responses API.

Сначала три тезиса
  • 3.8 Flash — стабильная модель GA, ID — gemini-3.8-flash, без суффикса preview.
  • Стартовая цена действует только до 2026-12-31; с 2027-01-01 стандарт станет $1.50 / $7.50.
  • Thinking token тарифицируются как выход. Чем выше уровень, тем заметнее может вырасти счёт за задачу — даже при той же ставке.

Что такое Gemini 3.8 Flash

По официальному анонсу Google, 3.8 — третья итерация Flash в семействе Gemini 3, примерно через три недели после 3.7 Flash. Та же скорость и та же стартовая цена, что у 3.7, но заметно сильнее в software engineering, Agent-задачах и многошаговом reasoning в профильных доменах. Одновременно вышли два варианта:

  • Gemini 3.8 Flash: универсальная рабочая лошадка для разработчиков и компаний — Gemini API, Google AI Studio, Gemini Enterprise, Antigravity, плюс Gemini app / Search AI Mode / Sheets (нужен Google AI Pro или Ultra).
  • Gemini 3.8 Flash Cyber: оборонительная модель для поиска уязвимостей и автопатчей. Доступ только через программу Fairwind — доверенным правительствам, критической инфраструктуре и мейнтейнерам. Здесь только публичный Flash; закрытые оборонительные интерфейсы не разбираем.

В карточке модели DeepMind указано: cutoff знаний в основном март 2026, часть доменов ещё на январе 2025 (как у всего семейства Gemini 3). Высокий уровень усилия может быть медленнее, чаще упираться в timeout и жечь больше token. Это не сноски на полях — это ограничения, которые надо закладывать в latency и счёт.

Google также сделал 3.8 Flash дефолтом для Antigravity Agent и Antigravity SDK. Новый hosted-проект Agent без смены конфига вызывает именно его.

Функции: контекст, уровни thinking и встроенные инструменты

По документации актуальных моделей Gemini публичные возможности укладываются в одну таблицу:

Параметр Gemini 3.8 Flash
Model ID gemini-3.8-flash (стабильная / GA)
Лимит входа 1,048,576 token (≈ 1M)
Макс. выход 65,536 token (в документации также 64K)
Уровень thinking low / medium (дефолт) / high; minimal даёт ошибку
Модальности входа текст, изображение, видео, аудио, PDF
Модальность выхода текст
Режим биллинга Standard, Batch, Flex, Priority

Как выбрать уровень thinking

Главная крутилка 3.8 Flash — thinking_level, а не ещё одно имя модели. Официальная логика такая:

  • low: чувствительность к задержке, черновики, классификация, простая перефразировка. Расход token минимальный.
  • medium (дефолт): большая часть сложного кода и циклов Agent. Обычно выше pass rate с первого прохода.
  • high: глубокий reasoning, математика, тяжёлая многошаговая оркестрация. Модель делает больше шагов и чаще вызывает инструменты.

Формулировка Google: 3.8 Flash «works harder» — старается сильнее. На сложных задачах она проходит лишние шаги и повторно вызывает инструменты; на high это особенно заметно. В независимых замерах выходных token на одну задачу у high бывает примерно на треть больше, чем у 3.7 Flash: ставка та же, стоимость задачи всё равно растёт. В проде фиксируйте уровень по типу задачи, не ставьте high на весь трафик.

Встроенные инструменты и модальности входа

3.8 Flash наследует набор инструментов Gemini 3: кэш контекста, выполнение кода, поиск по файлам, Function Calling, Structured Output, Search grounding, Maps grounding, URL context; Computer Use всё ещё Preview. Для Agent это значит: связку «модель + hosted-инструменты» можно прогнать сразу, а уже потом решать, какие действия обязаны вернуться в ваши функции.

Мультимодальный вход удобен, когда макет, скриншот ошибки, запись созвона или PDF-спека попадают в одну и ту же задачу Agent. Выход по-прежнему текст: в бизнес-систему лучше отдавать Structured Output или вашу проверку Schema, а не ждать, что модель «заодно» нарисует интерфейс.

Если вы ещё переезжаете с generateContent на Interactions API, сначала разведите слой интерфейса и слой состояния — и только потом меняйте имя модели. Порядок миграции: после обновления Gemini API 2026 какой слой Agent трогать первым.

Производительность: официальные бенчмарки и цена «большего старания»

Google подчёркивает: на нескольких открытых бенчмарках 3.8 Flash догоняет или обходит более дорогие frontier-модели, оставаясь в цене Flash:

  • DeepSWE v1.1 (длинный software engineering): по официальной оценке лучше большинства более крупных frontier-моделей; в сторонних сводных таблицах часто 73.7%–73.8%. Самооценка OpenAI для GPT-6 Astra — 74.1%. На одном и том же каркасе mini-swe-agent разрыв крошечный: три десятых процента — не повод объявлять победителя.
  • HLE-Verified (междисциплинарный многошаговый reasoning): официальная цифра 54.9%.
  • Профильные Agent: Vals Finance Agent V2, Harvey Legal Agent и другие — Google ставит 3.8 Flash выше 3.7 Flash и прочих frontier-моделей. Это выбранные вендором сцены: сигнал направления, а не ваш регрессионный набор.

Intelligence Index от Artificial Analysis ставит GPT-6 Astra выше (низкий thinking ≈ 57 vs 52; высокий сводный индекс в обзорах часто 59–67, методики не совпадают). Для инженерной команды полезнее другое: pass rate у coding Agent уже сидит в одной узкой полосе; счёт разъезжают расход token и ставка.

Разработчик отлаживает в редакторе код Gemini API и рабочие циклы Agent
Преимущество 3.8 Flash чаще видно на длинных задачах — многошаговые правки репозитория и повторные вызовы инструментов, а не в одноходовом Q&A.
Не вшивайте лидерборд в SLA

DeepSWE, HLE и GPQA зависят от обвязки оценки, уровня thinking и включённых инструментов. Другой репозиторий или другой timeout — и место в таблице поедет. Перед продом прогоните свои 20–50 регрессионных задач на 3.7 Flash, 3.8 Flash и Astra: pass rate, thoughtsTokenCount, wall-clock и стоимость в долларах.

Цены: стартовый период, подорожание в 2027 и ловушки биллинга

Таблица по опубликованным ставкам 3.8 Flash; единица — USD / миллион token. Стартовый период до 31 декабря 2026; с 1 января 2027 стандарт удваивается.

Режим Вход (до 2026-12-31) Выход (до 2026-12-31) Вход (с 2027-01-01) Выход (с 2027-01-01)
Standard $0.75 $3.75 $1.50 $7.50
Batch / Flex $0.375 $1.875 $0.75 $3.75
Priority $1.35 $6.75 $2.70 $13.50

Три статьи, которые легко потерять:

  1. Thinking token = выходные token. thoughtsTokenCount в ответе идёт в счёт по $3.75/M (стартовый период). Задача на high «вроде ответила на 2K знаков», а по факту уже нагенерила десятки тысяч thinking token.
  2. Кэш контекста, Search / Maps grounding — отдельно. У кэша есть запись и хранение, в 2027 их тоже подвинут; grounding-поиск после бесплатной квоты тарифицируется за запрос.
  3. 3.7 Flash никуда не делся. Если latency и расход token важнее pass rate, Google прямо советует остаться на 3.7 или держать 3.8 на low.

Грубая оценка сессии Agent по коду: 80,000 token входа (саммари репозитория + история + ответы инструментов), 20,000 token выхода вместе с thinking. Standard в стартовый период ≈ $0.06 + $0.075 = $0.135. Та же сессия на стандартном тарифе GPT-6 Astra (вход ≤272K) ≈ $0.80 + $1.00 = $1.80 — примерно в 13 раз. И это ещё без надбавки Astra на весь заказ после 272K входа.

Подписку, overage API и облачный Mac в одном месячном счёте см. в реальном расчёте месяца ИИ-программирования; правила наценки мультимодельного шлюза — в сравнении цен OpenRouter API.

API: model ID, Interactions и generateContent

У 3.8 Flash два интерфейса. Для новых проектов Google рекомендует Interactions API (POST /v1beta/interactions); существующий код чаще сидит на generateContent. Оба принимают один и тот же model ID.

Interactions API (схема)
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "input": "Summarize the failing test and propose a patch.",
    "generation_config": { "thinking_level": "medium" }
  }'

Легаси-путь — POST /v1beta/models/gemini-3.8-flash:generateContent. При миграции недостаточно подменить строку: Interactions продолжает сессию через previous_interaction_id, а generateContent обычно собирает историю сами. Цикл инструментов, потоковые события и возврат call_id нужно прогнать регрессией.

На проде имеет смысл зафиксировать четыре вещи:

  • В конфиге жёстко пропишите gemini-3.8-flash, не опирайтесь на алиас «последний Flash» — иначе модель сменится тихо.
  • Ставьте thinking_level по маршруту: черновики поддержки — low, правки репозитория — medium, математика / планирование — high.
  • В логах пишите и usage, и thoughtsTokenCount, иначе месячный счёт не сойдётся.
  • Structured Output отвечает за итоговый JSON, Function Calling — за промежуточные действия; не сваливайте это в одну Schema.

Потребительский вход — Gemini app и Search AI Mode; продакшен-Agent должен идти через Gemini API или Gemini Enterprise, с отдельным учётом ключей, квот и хранения данных. Серверное состояние Interactions живёт ограниченный срок; аудит-лог всё равно держите у себя.

Как сравнивать с GPT-6 Astra

GPT-6 Astra — флагман OpenAI начала сентября 2026, заточенный под «самые тяжёлые end-to-end задачи»: сложный reasoning, код, Computer Use, исследования и длинные документы. Спеки — со страницы модели OpenAI.

Измерение Gemini 3.8 Flash GPT-6 Astra
Позиционирование сильнейшая рабочая лошадка Flash / дефолт для Agent флагман, самые трудные задачи
Model ID gemini-3.8-flash gpt-6-astra
Релиз 2026-09-02 (GA) анонс 2026-09-03, API ≈ 09-04
Контекст / макс. выход ≈ 1.05M / 64K–65K 1,050,000 / 128,000
Управление thinking thinking_level: low / medium / high reasoning.effort: low–max (без none)
Стандартная ставка (до порога длинного контекста) $0.75 / $3.75 (стартовый период) $10 / $50; кэш входа $1, запись $12.50
Надбавка за длинный контекст в публичной таблице нет отдельного порога 272K вход >272K: весь заказ вход/кэш 2×, выход 1.5×
Основной API Interactions API + generateContent Responses API (набор инструментов шире)
Модальности входа текст / изображение / видео / аудио / PDF текст + изображение
Cutoff знаний в основном 2026-03 (часть 2025-01) 2026-04-30
DeepSWE v1.1 ≈ 73.7%–73.8% (сводные таблицы) 74.1% (самооценка OpenAI)

Инструменты Astra ближе к hosted-стеку вендора: веб-поиск, поиск по файлам, генерация изображений, Code Interpreter, hosted Shell, Apply Patch, Computer Use, Tool Search. Сильные стороны 3.8 Flash — мультимодальный вход, стартовая цена и grounding с поиском / картами / Workspace Google. У Astra на сверхдлинном входе дорожает весь заказ: засунули целиком репозиторий или досье на миллион token — и ставка с $10/$50 превращается в $20/$75.

Batch / Flex с обеих сторон примерно половина стандарта; у Astra отдельно есть Fast (≈ 2×), у Gemini — Priority (≈ 1.8×). Сравнивайте один и тот же класс сервиса, иначе вы сопоставляете «дешевле, но можно в очередь» и «дороже, но с приоритетом».

Как выбрать и как маршрутизировать

Не делайте «свежий флагман» единственным дефолтом. Надёжнее резать трафик по типу задачи:

  • Дефолт — 3.8 Flash medium: повседневный код, тикеты, RAG, большинство циклов Agent. Лучший баланс цены и качества в стартовый период.
  • Если важна задержка — 3.8 Flash low или оставьте 3.7 Flash: автодополнение, классификация, короткие ответы. Сначала смотрите p95, потом pass rate.
  • Трудные задачи поднимайте на Astra или 3.8 Flash high: рефакторинг сразу нескольких репозиториев, Computer Use, точечный поиск в длинных документах, отчёты, которым нужен выход 128K. Сравните pass rate и доллары на shadow-трафике, затем переключайте основной путь.
  • Бюджет 2027 пересчитайте по $1.50 / $7.50. Когда стартовая цена закончится, 3.8 Flash всё ещё сильно дешевле Astra, но это уже не почти бесплатный frontier.

Настоящая стоимость Agent часто сидит не в модели, а в среде исполнения: когда на Mac крутятся Xcode, подпись, симуляторы и локальный цикл инструментов, счета за модель и за машину надо вести отдельно. Облачный Mac Zilmac удобен тем, что стабильный Apple toolchain остаётся на фиксированном узле, а 3.8 Flash или Astra вызываются по API — без ключей, подписи и GPU-inference на одном хосте.

FAQ

Gemini 3.8 Flash и Gemini 3.8 Pro — это одно и то же?

Нет. 3.8 Flash — рабочая лошадка класса Flash: официально «та же скорость и цена, что у 3.7, сильнее reasoning». На момент текста (2026-09-08) в публичном GA продвигают gemini-3.8-flash; не переносите стартовую цену Flash на непроверенный прайс Pro.

Можно ли вызвать 3.8 Flash Cyber обычным Gemini API Key?

Не в логике обычной квоты разработчика. Cyber идёт через Fairwind, для доверенных оборонительных сторон. Обычный прод и потребительские сценарии — 3.8 Flash.

Чтобы перейти с 3.7 Flash на 3.8, достаточно сменить имя модели?

Model ID можно поменять сразу, но обязательно прогоните цикл инструментов, Structured Output и уровень thinking. 3.8 может чаще вызывать инструменты и жечь больше thinking token — поедут и задержка, и счёт. Сначала сравните на 5%–10% трафика, потом переключайте всё.

Кто сильнее — Gemini 3.8 Flash или GPT-6 Astra?

Единого ответа нет. На DeepSWE они почти вничью; Astra впереди в части сводных интеллектуальных индексов и наборе hosted-инструментов, 3.8 Flash — в ставке, мультимодальности и стартовом окне. Ориентир — ваш регрессионный набор и доллары на задачу, а не слайды с презентации.

Короткий вывод

  • 3.8 Flash: выгодный дефолт для Agent / кода осенью 2026 — сначала medium, следите за thinking token.
  • Astra: для задач, которые правда трудные и стоят $10/$50; помните порог 272K и плату за запись в кэш.
  • 2027-01-01: пересчитайте бюджет по удвоенной цене Flash, не зашивайте стартовую ставку в годовой контракт.

Модель — через API, сборка — на облачном Mac

Gemini 3.8 Flash и GPT-6 Astra закрывают inference; пайплайн iOS / macOS всё равно нуждается в Xcode, подписи и стабильном узле. Облачный Mac Zilmac фиксирует среду выполнения Agent.

Модель и машина тарифицируются и масштабируются отдельно. — Смотреть тарифы облачного Mac

Лимитированное предложение

Zilmac

Облачный Mac, удалённая разработка и Mac VPS — Apple toolchain для iOS и кроссплатформенных команд.

На главную
Лимитированное предложение Смотреть планы