Gemini 3.8 Flash — свежая рабочая лошадка класса Flash от Google, вышедшая 2 сентября 2026 года. Ниша — длинные инженерные задачи, автономные Agent и многошаговые корпоративные пайплайны. Это не флагманский Pro линейки Gemini 3, а почти передовой reasoning и код, уложенные в скорость и стартовую цену Flash: $0.75 за миллион входных token и $3.75 за выход — до 31 декабря 2026.
В ту же неделю OpenAI выкатил флагман GPT-6 Astra (API model ID gpt-6-astra) со стандартной ценой $10 / $50 за миллион вход / выход. Оба бьют в Agent, код и длинный контекст, но счета расходятся на порядок. Ниже — функции, производительность, цены и API по официальному блогу Google, документации Gemini API, карточке модели DeepMind и странице модели OpenAI. Самооценки вендоров — ориентир, не приёмка.
Текст для трёх аудиторий: команд Agent / ассистентов, которым нужен дефолт; платформ и финансов, которые считают месячный счёт; инженеров, которые пишут адаптер между Gemini Interactions API и OpenAI Responses API.
- 3.8 Flash — стабильная модель GA, ID —
gemini-3.8-flash, без суффикса preview. - Стартовая цена действует только до 2026-12-31; с 2027-01-01 стандарт станет $1.50 / $7.50.
- Thinking token тарифицируются как выход. Чем выше уровень, тем заметнее может вырасти счёт за задачу — даже при той же ставке.
Что такое Gemini 3.8 Flash
По официальному анонсу Google, 3.8 — третья итерация Flash в семействе Gemini 3, примерно через три недели после 3.7 Flash. Та же скорость и та же стартовая цена, что у 3.7, но заметно сильнее в software engineering, Agent-задачах и многошаговом reasoning в профильных доменах. Одновременно вышли два варианта:
- Gemini 3.8 Flash: универсальная рабочая лошадка для разработчиков и компаний — Gemini API, Google AI Studio, Gemini Enterprise, Antigravity, плюс Gemini app / Search AI Mode / Sheets (нужен Google AI Pro или Ultra).
- Gemini 3.8 Flash Cyber: оборонительная модель для поиска уязвимостей и автопатчей. Доступ только через программу Fairwind — доверенным правительствам, критической инфраструктуре и мейнтейнерам. Здесь только публичный Flash; закрытые оборонительные интерфейсы не разбираем.
В карточке модели DeepMind указано: cutoff знаний в основном март 2026, часть доменов ещё на январе 2025 (как у всего семейства Gemini 3). Высокий уровень усилия может быть медленнее, чаще упираться в timeout и жечь больше token. Это не сноски на полях — это ограничения, которые надо закладывать в latency и счёт.
Google также сделал 3.8 Flash дефолтом для Antigravity Agent и Antigravity SDK. Новый hosted-проект Agent без смены конфига вызывает именно его.
Функции: контекст, уровни thinking и встроенные инструменты
По документации актуальных моделей Gemini публичные возможности укладываются в одну таблицу:
| Параметр | Gemini 3.8 Flash |
|---|---|
| Model ID | gemini-3.8-flash (стабильная / GA) |
| Лимит входа | 1,048,576 token (≈ 1M) |
| Макс. выход | 65,536 token (в документации также 64K) |
| Уровень thinking | low / medium (дефолт) / high; minimal даёт ошибку |
| Модальности входа | текст, изображение, видео, аудио, PDF |
| Модальность выхода | текст |
| Режим биллинга | Standard, Batch, Flex, Priority |
Как выбрать уровень thinking
Главная крутилка 3.8 Flash — thinking_level, а не ещё одно имя модели. Официальная логика такая:
- low: чувствительность к задержке, черновики, классификация, простая перефразировка. Расход token минимальный.
- medium (дефолт): большая часть сложного кода и циклов Agent. Обычно выше pass rate с первого прохода.
- high: глубокий reasoning, математика, тяжёлая многошаговая оркестрация. Модель делает больше шагов и чаще вызывает инструменты.
Формулировка Google: 3.8 Flash «works harder» — старается сильнее. На сложных задачах она проходит лишние шаги и повторно вызывает инструменты; на high это особенно заметно. В независимых замерах выходных token на одну задачу у high бывает примерно на треть больше, чем у 3.7 Flash: ставка та же, стоимость задачи всё равно растёт. В проде фиксируйте уровень по типу задачи, не ставьте high на весь трафик.
Встроенные инструменты и модальности входа
3.8 Flash наследует набор инструментов Gemini 3: кэш контекста, выполнение кода, поиск по файлам, Function Calling, Structured Output, Search grounding, Maps grounding, URL context; Computer Use всё ещё Preview. Для Agent это значит: связку «модель + hosted-инструменты» можно прогнать сразу, а уже потом решать, какие действия обязаны вернуться в ваши функции.
Мультимодальный вход удобен, когда макет, скриншот ошибки, запись созвона или PDF-спека попадают в одну и ту же задачу Agent. Выход по-прежнему текст: в бизнес-систему лучше отдавать Structured Output или вашу проверку Schema, а не ждать, что модель «заодно» нарисует интерфейс.
Если вы ещё переезжаете с generateContent на Interactions API, сначала разведите слой интерфейса и слой состояния — и только потом меняйте имя модели. Порядок миграции: после обновления Gemini API 2026 какой слой Agent трогать первым.
Производительность: официальные бенчмарки и цена «большего старания»
Google подчёркивает: на нескольких открытых бенчмарках 3.8 Flash догоняет или обходит более дорогие frontier-модели, оставаясь в цене Flash:
- DeepSWE v1.1 (длинный software engineering): по официальной оценке лучше большинства более крупных frontier-моделей; в сторонних сводных таблицах часто 73.7%–73.8%. Самооценка OpenAI для GPT-6 Astra — 74.1%. На одном и том же каркасе mini-swe-agent разрыв крошечный: три десятых процента — не повод объявлять победителя.
- HLE-Verified (междисциплинарный многошаговый reasoning): официальная цифра 54.9%.
- Профильные Agent: Vals Finance Agent V2, Harvey Legal Agent и другие — Google ставит 3.8 Flash выше 3.7 Flash и прочих frontier-моделей. Это выбранные вендором сцены: сигнал направления, а не ваш регрессионный набор.
Intelligence Index от Artificial Analysis ставит GPT-6 Astra выше (низкий thinking ≈ 57 vs 52; высокий сводный индекс в обзорах часто 59–67, методики не совпадают). Для инженерной команды полезнее другое: pass rate у coding Agent уже сидит в одной узкой полосе; счёт разъезжают расход token и ставка.
DeepSWE, HLE и GPQA зависят от обвязки оценки, уровня thinking и включённых инструментов. Другой репозиторий или другой timeout — и место в таблице поедет. Перед продом прогоните свои 20–50 регрессионных задач на 3.7 Flash, 3.8 Flash и Astra: pass rate, thoughtsTokenCount, wall-clock и стоимость в долларах.
Цены: стартовый период, подорожание в 2027 и ловушки биллинга
Таблица по опубликованным ставкам 3.8 Flash; единица — USD / миллион token. Стартовый период до 31 декабря 2026; с 1 января 2027 стандарт удваивается.
| Режим | Вход (до 2026-12-31) | Выход (до 2026-12-31) | Вход (с 2027-01-01) | Выход (с 2027-01-01) |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $1.50 | $7.50 |
| Batch / Flex | $0.375 | $1.875 | $0.75 | $3.75 |
| Priority | $1.35 | $6.75 | $2.70 | $13.50 |
Три статьи, которые легко потерять:
- Thinking token = выходные token.
thoughtsTokenCountв ответе идёт в счёт по $3.75/M (стартовый период). Задача на high «вроде ответила на 2K знаков», а по факту уже нагенерила десятки тысяч thinking token. - Кэш контекста, Search / Maps grounding — отдельно. У кэша есть запись и хранение, в 2027 их тоже подвинут; grounding-поиск после бесплатной квоты тарифицируется за запрос.
- 3.7 Flash никуда не делся. Если latency и расход token важнее pass rate, Google прямо советует остаться на 3.7 или держать 3.8 на
low.
Грубая оценка сессии Agent по коду: 80,000 token входа (саммари репозитория + история + ответы инструментов), 20,000 token выхода вместе с thinking. Standard в стартовый период ≈ $0.06 + $0.075 = $0.135. Та же сессия на стандартном тарифе GPT-6 Astra (вход ≤272K) ≈ $0.80 + $1.00 = $1.80 — примерно в 13 раз. И это ещё без надбавки Astra на весь заказ после 272K входа.
Подписку, overage API и облачный Mac в одном месячном счёте см. в реальном расчёте месяца ИИ-программирования; правила наценки мультимодельного шлюза — в сравнении цен OpenRouter API.
API: model ID, Interactions и generateContent
У 3.8 Flash два интерфейса. Для новых проектов Google рекомендует Interactions API (POST /v1beta/interactions); существующий код чаще сидит на generateContent. Оба принимают один и тот же model ID.
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Summarize the failing test and propose a patch.",
"generation_config": { "thinking_level": "medium" }
}'
Легаси-путь — POST /v1beta/models/gemini-3.8-flash:generateContent. При миграции недостаточно подменить строку: Interactions продолжает сессию через previous_interaction_id, а generateContent обычно собирает историю сами. Цикл инструментов, потоковые события и возврат call_id нужно прогнать регрессией.
На проде имеет смысл зафиксировать четыре вещи:
- В конфиге жёстко пропишите
gemini-3.8-flash, не опирайтесь на алиас «последний Flash» — иначе модель сменится тихо. - Ставьте
thinking_levelпо маршруту: черновики поддержки —low, правки репозитория —medium, математика / планирование —high. - В логах пишите и
usage, иthoughtsTokenCount, иначе месячный счёт не сойдётся. - Structured Output отвечает за итоговый JSON, Function Calling — за промежуточные действия; не сваливайте это в одну Schema.
Потребительский вход — Gemini app и Search AI Mode; продакшен-Agent должен идти через Gemini API или Gemini Enterprise, с отдельным учётом ключей, квот и хранения данных. Серверное состояние Interactions живёт ограниченный срок; аудит-лог всё равно держите у себя.
Как сравнивать с GPT-6 Astra
GPT-6 Astra — флагман OpenAI начала сентября 2026, заточенный под «самые тяжёлые end-to-end задачи»: сложный reasoning, код, Computer Use, исследования и длинные документы. Спеки — со страницы модели OpenAI.
| Измерение | Gemini 3.8 Flash | GPT-6 Astra |
|---|---|---|
| Позиционирование | сильнейшая рабочая лошадка Flash / дефолт для Agent | флагман, самые трудные задачи |
| Model ID | gemini-3.8-flash |
gpt-6-astra |
| Релиз | 2026-09-02 (GA) | анонс 2026-09-03, API ≈ 09-04 |
| Контекст / макс. выход | ≈ 1.05M / 64K–65K | 1,050,000 / 128,000 |
| Управление thinking | thinking_level: low / medium / high |
reasoning.effort: low–max (без none) |
| Стандартная ставка (до порога длинного контекста) | $0.75 / $3.75 (стартовый период) | $10 / $50; кэш входа $1, запись $12.50 |
| Надбавка за длинный контекст | в публичной таблице нет отдельного порога 272K | вход >272K: весь заказ вход/кэш 2×, выход 1.5× |
| Основной API | Interactions API + generateContent | Responses API (набор инструментов шире) |
| Модальности входа | текст / изображение / видео / аудио / PDF | текст + изображение |
| Cutoff знаний | в основном 2026-03 (часть 2025-01) | 2026-04-30 |
| DeepSWE v1.1 | ≈ 73.7%–73.8% (сводные таблицы) | 74.1% (самооценка OpenAI) |
Инструменты Astra ближе к hosted-стеку вендора: веб-поиск, поиск по файлам, генерация изображений, Code Interpreter, hosted Shell, Apply Patch, Computer Use, Tool Search. Сильные стороны 3.8 Flash — мультимодальный вход, стартовая цена и grounding с поиском / картами / Workspace Google. У Astra на сверхдлинном входе дорожает весь заказ: засунули целиком репозиторий или досье на миллион token — и ставка с $10/$50 превращается в $20/$75.
Batch / Flex с обеих сторон примерно половина стандарта; у Astra отдельно есть Fast (≈ 2×), у Gemini — Priority (≈ 1.8×). Сравнивайте один и тот же класс сервиса, иначе вы сопоставляете «дешевле, но можно в очередь» и «дороже, но с приоритетом».
Как выбрать и как маршрутизировать
Не делайте «свежий флагман» единственным дефолтом. Надёжнее резать трафик по типу задачи:
- Дефолт — 3.8 Flash
medium: повседневный код, тикеты, RAG, большинство циклов Agent. Лучший баланс цены и качества в стартовый период. - Если важна задержка — 3.8 Flash
lowили оставьте 3.7 Flash: автодополнение, классификация, короткие ответы. Сначала смотрите p95, потом pass rate. - Трудные задачи поднимайте на Astra или 3.8 Flash
high: рефакторинг сразу нескольких репозиториев, Computer Use, точечный поиск в длинных документах, отчёты, которым нужен выход 128K. Сравните pass rate и доллары на shadow-трафике, затем переключайте основной путь. - Бюджет 2027 пересчитайте по $1.50 / $7.50. Когда стартовая цена закончится, 3.8 Flash всё ещё сильно дешевле Astra, но это уже не почти бесплатный frontier.
Настоящая стоимость Agent часто сидит не в модели, а в среде исполнения: когда на Mac крутятся Xcode, подпись, симуляторы и локальный цикл инструментов, счета за модель и за машину надо вести отдельно. Облачный Mac Zilmac удобен тем, что стабильный Apple toolchain остаётся на фиксированном узле, а 3.8 Flash или Astra вызываются по API — без ключей, подписи и GPU-inference на одном хосте.
FAQ
Gemini 3.8 Flash и Gemini 3.8 Pro — это одно и то же?
Нет. 3.8 Flash — рабочая лошадка класса Flash: официально «та же скорость и цена, что у 3.7, сильнее reasoning». На момент текста (2026-09-08) в публичном GA продвигают gemini-3.8-flash; не переносите стартовую цену Flash на непроверенный прайс Pro.
Можно ли вызвать 3.8 Flash Cyber обычным Gemini API Key?
Не в логике обычной квоты разработчика. Cyber идёт через Fairwind, для доверенных оборонительных сторон. Обычный прод и потребительские сценарии — 3.8 Flash.
Чтобы перейти с 3.7 Flash на 3.8, достаточно сменить имя модели?
Model ID можно поменять сразу, но обязательно прогоните цикл инструментов, Structured Output и уровень thinking. 3.8 может чаще вызывать инструменты и жечь больше thinking token — поедут и задержка, и счёт. Сначала сравните на 5%–10% трафика, потом переключайте всё.
Кто сильнее — Gemini 3.8 Flash или GPT-6 Astra?
Единого ответа нет. На DeepSWE они почти вничью; Astra впереди в части сводных интеллектуальных индексов и наборе hosted-инструментов, 3.8 Flash — в ставке, мультимодальности и стартовом окне. Ориентир — ваш регрессионный набор и доллары на задачу, а не слайды с презентации.
Короткий вывод
- 3.8 Flash: выгодный дефолт для Agent / кода осенью 2026 — сначала
medium, следите за thinking token. - Astra: для задач, которые правда трудные и стоят $10/$50; помните порог 272K и плату за запись в кэш.
- 2027-01-01: пересчитайте бюджет по удвоенной цене Flash, не зашивайте стартовую ставку в годовой контракт.
Модель — через API, сборка — на облачном Mac
Gemini 3.8 Flash и GPT-6 Astra закрывают inference; пайплайн iOS / macOS всё равно нуждается в Xcode, подписи и стабильном узле. Облачный Mac Zilmac фиксирует среду выполнения Agent.
Модель и машина тарифицируются и масштабируются отдельно. — Смотреть тарифы облачного Mac