Gemini 3.8 Flash est le dernier modèle Flash « cheval de trait » publié par Google le 2 septembre 2026, pensé pour le génie logiciel de longue haleine, les agents autonomes et les workflows d'entreprise multi-étapes. Ce n'est pas le Pro phare de la famille Gemini 3 : c'est un raisonnement et une capacité de code proches de la frontière, compressés dans la vitesse et le tarif d'introduction Flash — $0.75 par million de token d'entrée, $3.75 en sortie, valable jusqu'au 31 décembre 2026.
La même semaine, OpenAI a sorti son phare GPT-6 Astra (ID API gpt-6-astra), au tarif standard de $10 par million d'entrée et $50 en sortie. Les deux misent sur les agents, le code et le long contexte ; la facture, elle, diverge d'un ordre de grandeur. À partir du blog officiel Google, de la doc Gemini API, de la fiche modèle DeepMind et de la page modèle OpenAI, on détaille fonctions, performances, prix et API, avec un choix applicable — sans traiter les scores auto-déclarés comme une recette définitive.
Trois publics : les équipes Agent / assistants de code qui doivent figer un modèle par défaut ; les plateformes et les finances qui estiment la facture mensuelle ; les ingénieurs qui posent une couche d'adaptation entre Gemini Interactions API et OpenAI Responses API.
- 3.8 Flash est un modèle GA stable : l'ID est
gemini-3.8-flash, sans suffixe preview. - Le tarif d'introduction s'arrête au 2026-12-31 ; à partir du 2027-01-01, le standard passe à $1.50 / $7.50.
- Les token de réflexion sont facturés en sortie. Plus le niveau est haut, plus la facture par tâche peut monter, même si le prix unitaire ne bouge pas.
Qu'est-ce que Gemini 3.8 Flash
Selon l'annonce officielle Google, 3.8 est la troisième itération Flash de la famille Gemini 3, environ trois semaines après 3.7 Flash. Même vitesse, même tarif d'introduction que 3.7, mais nettement plus fort en génie logiciel, tâches Agent et raisonnement multi-étapes dans des domaines spécialisés. Google a publié deux variantes en parallèle :
- Gemini 3.8 Flash : cheval de trait généraliste pour développeurs et entreprises, via Gemini API, Google AI Studio, Gemini Enterprise, Antigravity, ainsi que Gemini app / Search AI Mode / Sheets (Google AI Pro ou Ultra requis).
- Gemini 3.8 Flash Cyber : modèle défensif pour la découverte de vulnérabilités et les correctifs automatiques, ouvert uniquement via le programme Fairwind à des acteurs gouvernementaux, d'infrastructures critiques et de maintenance logicielle de confiance. Ici, on ne traite que le Flash public, pas les interfaces défensives non publiées.
La fiche modèle DeepMind le dit clairement : la coupure des connaissances est surtout mars 2026 ; certains domaines restent à janvier 2025 (comme le reste de la famille Gemini 3). Un niveau d'effort élevé peut être plus lent, plus sujet aux timeouts, et consommer plus de token. Ce n'est pas du détail : ce sont des contraintes à intégrer dès qu'on estime latence et facture.
Google a aussi fait de 3.8 Flash le modèle par défaut d'Antigravity Agent et du SDK Antigravity. Un projet Agent hébergé tout neuf, sans changement de config, l'appelle déjà.
Fonctions : contexte, niveaux de réflexion et outils intégrés
D'après la doc des derniers modèles Gemini, les capacités publiques tiennent dans une fiche :
| Spécification | Gemini 3.8 Flash |
|---|---|
| ID de modèle | gemini-3.8-flash (stable / GA) |
| Limite d'entrée | 1,048,576 token (environ 1M) |
| Sortie max | 65,536 token (la doc écrit aussi 64K) |
| Niveaux de réflexion | low / medium (défaut) / high ; minimal renvoie une erreur |
| Modalités d'entrée | Texte, image, vidéo, audio, PDF |
| Modalités de sortie | Texte |
| Modes de facturation | Standard, Batch, Flex, Priority |
Comment choisir le niveau de réflexion
Le vrai bouton de 3.8 Flash, c'est thinking_level, pas un autre nom de modèle. Lecture utile de la reco officielle :
- low : sensible à la latence, brouillons, classification, reformulations simples. Coût token le plus bas.
- medium (défaut) : la plupart du code complexe et des boucles Agent. Le taux de réussite au premier tour est en général meilleur.
- high : raisonnement profond, maths, orchestrations multi-étapes difficiles. Le modèle fait plus d'étapes de raisonnement et plus d'appels d'outils.
Google le dit ainsi : 3.8 Flash « works harder » (travaille plus dur). Sur une tâche complexe, il fait quelques pas de plus, rappelle les outils ; surtout en high. Dans des évaluations indépendantes, les token de sortie par tâche en high peuvent dépasser 3.7 Flash d'environ 30 % — le prix unitaire n'a pas bougé, le coût par tâche oui. En production, verrouillez le niveau par type de tâche ; n'activez pas high partout.
Outils intégrés et modalités d'entrée
3.8 Flash hérite de la surface d'outils Gemini 3 : cache de contexte, exécution de code, recherche de fichiers, Function Calling, Structured Output, Search grounding, Maps grounding, URL context ; Computer Use reste en Preview. Pour un Agent, cela veut dire qu'on peut d'abord faire tourner « modèle + outils hébergés », puis décider quelles actions doivent revenir à vos propres fonctions.
L'entrée multimodale sert surtout à ça : maquette, capture d'erreur, enregistrement de réunion ou spec PDF dans la même tâche Agent. La sortie reste du texte : à la livraison vers le système métier, il faut encore Structured Output ou votre propre validation Schema — pas compter sur le modèle pour « au passage » dessiner une interface.
Si vous migrez encore de generateContent vers Interactions API, séparez d'abord la couche interface et la couche d'état, puis changez le nom de modèle. L'ordre de migration : Après la mise à jour Gemini API 2026, quelle couche l'Agent doit-il changer d'abord.
Performances : benchmarks officiels et le prix de « travailler plus dur »
Google insiste : sur plusieurs benchmarks publics, 3.8 Flash approche voire dépasse des modèles frontier plus chers, tout en restant au tarif Flash :
- DeepSWE v1.1 (génie logiciel long terme) : Google le dit supérieur à la plupart des plus gros modèles frontier ; les tableaux tiers citent souvent 73.7%–73.8%. OpenAI auto-déclare 74.1% pour GPT-6 Astra. Les deux sont très proches sur le même framework mini-swe-agent ; 0,3 point ne départage pas.
- HLE-Verified (raisonnement multi-étapes interdisciplinaire) : chiffre officiel 54.9%.
- Agents spécialisés : Vals Finance Agent V2, Harvey Legal Agent, etc. — Google dit mieux que 3.7 Flash et d'autres frontier. Ce sont des scénarios choisis par l'éditeur : un signal de direction, pas le jeu de régression de votre dépôt.
L'Intelligence Index d'Artificial Analysis place GPT-6 Astra un cran au-dessus (niveau bas ~57 vs 52 ; l'index composite haut est souvent cité entre 59–67, les définitions divergent). Pour une équipe d'ingénierie, le constat utile : les taux de réussite des agents de code se serrent déjà dans la même bande étroite ; ce qui écarte vraiment les factures, c'est la consommation de token et le prix unitaire.
DeepSWE, HLE, GPQA dépendent tous du harness d'évaluation, du niveau de réflexion et des interrupteurs d'outils. Changez de dépôt, changez de stratégie de timeout, le classement bouge. Avant la prod, comparez 3.7 Flash, 3.8 Flash et Astra sur vos 20–50 tâches de régression ; notez le taux de réussite, thoughtsTokenCount, le temps wall-clock et le coût en dollars.
Prix : période d'introduction, hausse 2027 et pièges de facturation
Le tableau reprend les prix unitaires 3.8 Flash publiés par Google, en USD / million de token. Période d'introduction jusqu'au 31 décembre 2026 ; à partir du 1er janvier 2027, le tarif standard double.
| Mode | Entrée (jusqu'au 2026-12-31) | Sortie (jusqu'au 2026-12-31) | Entrée (à partir du 2027-01-01) | Sortie (à partir du 2027-01-01) |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $1.50 | $7.50 |
| Batch / Flex | $0.375 | $1.875 | $0.75 | $3.75 |
| Priority | $1.35 | $6.75 | $2.70 | $13.50 |
Trois points souvent oubliés :
- Token de réflexion = token de sortie. Le
thoughtsTokenCountde la réponse entre dans la facture à $3.75/M (période d'introduction). Une tâche high « qui n'a renvoyé que 2K de texte » peut déjà avoir produit des dizaines de milliers de token de réflexion. - Cache de contexte, Search / Maps grounding se facturent à part. Le cache a des frais d'écriture et de stockage, ajustés aussi en 2027 ; le grounding se facture à la requête une fois le quota gratuit épuisé.
- 3.7 Flash reste disponible. Si latence et coût token importent plus que le taux de réussite, Google recommande clairement de rester sur 3.7, ou de verrouiller 3.8 sur
low.
Ordre de grandeur d'une session Agent de code : 80,000 token d'entrée (résumé de dépôt + historique + retours d'outils), 20,000 token de sortie avec réflexion. Standard en période d'introduction : environ $0.06 + $0.075 = $0.135. La même session au tarif standard GPT-6 Astra (≤272K d'entrée) : environ $0.80 + $1.00 = $1.80, soit ~13 fois plus. Et ça n'inclut pas la hausse Astra au-delà de 272K d'entrée.
Pour la facture mensuelle abonnements + API hors forfait + Mac cloud, voir Combien coûte vraiment un mois de programmation IA ; les règles de majoration des passerelles multi-modèles : Comparatif des prix OpenRouter API.
API : ID de modèle, Interactions et generateContent
3.8 Flash passe par deux interfaces. Pour un projet neuf, Google recommande Interactions API (POST /v1beta/interactions) ; le code existant reste surtout sur generateContent. Les deux reconnaissent le même ID de modèle.
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Summarize the failing test and propose a patch.",
"generation_config": { "thinking_level": "medium" }
}'
Le chemin existant est POST /v1beta/models/gemini-3.8-flash:generateContent. En migrant, ne changez pas seulement une chaîne : Interactions reprend avec previous_interaction_id, generateContent assemble généralement l'historique vous-même. Boucles d'outils, événements de streaming et retours call_id doivent tous passer en régression.
En prod, figez quatre choses :
- Écrivez
gemini-3.8-flashen dur dans la config ; ne dépendez pas d'un alias « dernier Flash », pour éviter un changement silencieux. - Réglez
thinking_levelpar route : brouillons supportlow, modifications de dépôtmedium, maths / planificationhigh. - Journalisez à la fois
usageetthoughtsTokenCount, sinon la facture mensuelle ne colle pas. - Structured Output pour le JSON final, Function Calling pour les actions intermédiaires : ne les mélangez pas dans un seul Schema.
L'entrée grand public, c'est Gemini app et Search AI Mode ; un Agent de production doit passer par Gemini API ou Gemini Enterprise, avec clés, quotas et rétention gérés à part. L'état serveur d'Interactions a une durée de rétention ; les journaux d'audit restent dans votre propre stockage.
Comparaison avec GPT-6 Astra
GPT-6 Astra est le phare OpenAI sorti début septembre 2026, pour « les travaux de bout en bout les plus durs » : raisonnement complexe, code, Computer Use, recherche et longs documents. Specs d'après la page modèle OpenAI.
| Critère | Gemini 3.8 Flash | GPT-6 Astra |
|---|---|---|
| Positionnement | Meilleur Flash cheval de trait / modèle Agent par défaut | Phare, tâches les plus dures |
| ID de modèle | gemini-3.8-flash |
gpt-6-astra |
| Sortie | 2026-09-02 (GA) | Annoncé 2026-09-03, API vers le 09-04 |
| Contexte / sortie max | environ 1.05M / 64K–65K | 1,050,000 / 128,000 |
| Contrôle de la réflexion | thinking_level : low / medium / high |
reasoning.effort : low–max (pas de none) |
| Prix unitaire standard (≤ seuil long contexte) | $0.75 / $3.75 (période d'introduction) | $10 / $50 ; entrée en cache $1, écriture $12.50 |
| Majoration long contexte | Le tableau public n'isole pas de seuil 272K | Entrée >272K : entrée/cache ×2 sur toute la requête, sortie ×1.5 |
| Interface principale | Interactions API + generateContent | Responses API (surface d'outils plus complète) |
| Modalités d'entrée | Texte / image / vidéo / audio / PDF | Texte + image |
| Coupure des connaissances | Surtout 2026-03 (parfois 2025-01) | 2026-04-30 |
| DeepSWE v1.1 | environ 73.7%–73.8% (tableaux de comparaison) | 74.1% (auto-déclaré OpenAI) |
La surface d'outils d'Astra penche plus « hébergée côté hôte » : recherche web, recherche de fichiers, génération d'images, Code Interpreter, Shell hébergé, Apply Patch, Computer Use, Tool Search. Les atouts de 3.8 Flash : l'entrée multimodale, le tarif d'introduction, et le grounding Google Search / Maps / Workspace. Astra majore aussi toute la requête au-delà d'une entrée très longue : envoyer un dépôt entier ou un dossier d'un million de token d'un coup fait passer le prix unitaire de $10/$50 à $20/$75.
Batch / Flex des deux côtés valent environ la moitié du tarif standard ; Astra a aussi Fast (~2×), Gemini a Priority (~1.8×). En comparant, alignez le même niveau de service, sinon vous comparez « pas cher mais en file » et « cher mais prioritaire ».
Comment choisir et router
Ne faites pas du « dernier phare » le seul défaut. Plus robuste : classer par tâche.
- Par défaut : 3.8 Flash
medium: modifications de code quotidiennes, tickets, RAG, la plupart des boucles Agent. Meilleur rapport qualité-prix pendant l'introduction. - Latence sensible : 3.8 Flash
lowou rester sur 3.7 Flash : complétion, classification, réponses courtes. Regardez d'abord le p95, ensuite le taux de réussite. - Tâches dures : Astra ou 3.8 Flash
high: refacto cross-dépôts, Computer Use, recherche chirurgicale dans de longs docs, rapports qui ont besoin de 128K de sortie. Comparez taux de réussite et dollars en trafic fantôme avant de basculer le chemin principal. - Le budget 2027 se recalcule à $1.50 / $7.50. Une fois le tarif d'introduction disparu, 3.8 Flash reste loin sous Astra, mais ce n'est plus du « frontier presque gratuit ».
Le vrai coût d'un Agent n'est souvent pas le modèle, mais l'environnement d'exécution : Xcode, signature, simulateurs et boucles d'outils locales sur Mac. Facture modèle et facture machine se calculent à part. Un Mac cloud Zilmac convient pour laisser la toolchain Apple stable sur un nœud fixe, puis appeler 3.8 Flash ou Astra via API — plutôt que d'empiler clés, signature et inférence GPU sur la même machine.
FAQ
Gemini 3.8 Flash et Gemini 3.8 Pro, c'est la même chose ?
Non. 3.8 Flash est le cheval de trait de la gamme Flash ; Google insiste sur « même vitesse et même prix que 3.7, meilleur raisonnement ». Au moment de la rédaction (2026-09-08), le GA public mis en avant est gemini-3.8-flash ; n'appliquez pas le tarif d'introduction Flash à une grille Pro non vérifiée.
Peut-on appeler 3.8 Flash Cyber avec une clé Gemini API classique ?
Pas au sens d'un quota développeur ordinaire. Cyber passe par Fairwind, pour des acteurs défensifs de confiance. Prod et usage grand public : 3.8 Flash.
Passer de 3.7 Flash à 3.8, suffit-il de changer le nom de modèle ?
Vous pouvez changer l'ID d'abord, mais il faut régresser les boucles d'outils, Structured Output et le niveau de réflexion. 3.8 peut appeler plus d'outils et dépenser plus de token de réflexion : latence et facture bougent. Comparez d'abord sur 5%–10% du trafic, puis basculez tout.
Gemini 3.8 Flash ou GPT-6 Astra : qui est plus fort ?
Pas de réponse unique. Sur DeepSWE les deux sont quasi à égalité ; Astra mène sur certains indices composites et la surface d'outils hébergés, 3.8 Flash sur le prix unitaire, le multimodal et la fenêtre d'introduction. Fiez-vous à votre jeu de régression et au dollar par tâche, pas aux slides de keynote.
En une phrase
- 3.8 Flash : option qualité-prix pour le modèle Agent / code par défaut à l'automne 2026 ; verrouillez d'abord
medium, surveillez les token de réflexion. - Astra : pour les tâches vraiment dures, qui valent $10/$50 ; attention au seuil 272K et aux frais d'écriture du cache.
- 2027-01-01 : refaites le budget au tarif Flash doublé ; n'écrivez pas le tarif d'introduction dans un contrat annuel.
Le modèle via API, le build sur Mac cloud
Gemini 3.8 Flash et GPT-6 Astra couvrent l'inférence ; les pipelines iOS / macOS ont toujours besoin de Xcode, de signature et d'un nœud stable. Un Mac cloud Zilmac fixe l'environnement d'exécution de l'Agent.
Modèle et machine se facturent et s'échelonnent à part. — Voir les forfaits Mac cloud