Gemini 3.8 Flash ist Googles neuestes Flash-Arbeitspferd, veröffentlicht am 2. September 2026. Es zielt auf langlebige Software-Engineering-Aufgaben, autonome Agents und mehrstufige Unternehmens-Workflows. Es ist nicht das Flaggschiff-Pro der Gemini-3-Familie, sondern packt nahezu Frontier-Reasoning und Programmierkompetenz in Flash-Tempo und Einführungspreis: $0.75 pro Million Input-Token, $3.75 Output — gültig bis 31. Dezember 2026.
In derselben Woche hat OpenAI das Flaggschiff GPT-6 Astra freigegeben (API-Modell-ID gpt-6-astra), Standardpreis $10 pro Million Input, $50 Output. Beide setzen auf Agents, Programmierung und langen Kontext — die Rechnung unterscheidet sich um eine Größenordnung. Dieser Artikel zerlegt Funktionen, Leistung, Preise und API anhand von Googles offiziellem Blog, der Gemini-API-Dokumentation, der DeepMind-Modellkarte und der OpenAI-Modellseite und gibt eine umsetzbare Auswahl. Hersteller-Selbstangaben sind kein Abnahmekriterium.
Drei Lesergruppen: Teams für Agents / Programmierassistenten, die ein Standardmodell festlegen müssen; Plattform- und Finance-Teams, die die Monatsrechnung schätzen; Engineers, die eine Adaptionsschicht zwischen Gemini Interactions API und OpenAI Responses API bauen.
- 3.8 Flash ist ein GA-Stabilmodell. Die ID lautet
gemini-3.8-flash, ohne Preview-Suffix. - Der Einführungspreis gilt nur bis 2026-12-31; ab 2027-01-01 liegt der Standardpreis bei $1.50 / $7.50.
- Thinking-Token werden als Ausgabe abgerechnet. Höhere Stufen können die Rechnung pro Aufgabe deutlich erhöhen — auch wenn der Einzelpreis gleich bleibt.
Was Gemini 3.8 Flash ist
Laut Googles offizieller Veröffentlichung ist 3.8 die dritte Flash-Iteration der Gemini-3-Familie, rund drei Wochen nach 3.7 Flash. Tempo und Einführungspreis entsprechen 3.7, Software Engineering, Agent-Aufgaben und mehrstufiges Reasoning in Fachdomänen sind klar stärker. Offiziell gibt es zwei Varianten:
- Gemini 3.8 Flash: allgemeines Arbeitspferd für Entwickler und Unternehmen — über Gemini API, Google AI Studio, Gemini Enterprise, Antigravity sowie Gemini App / Search AI Mode / Sheets (Google AI Pro oder Ultra nötig).
- Gemini 3.8 Flash Cyber: defensiv ausgerichtetes Modell für Schwachstellensuche und automatische Patches, nur über das Fairwind-Programm für vertrauenswürdige Stellen in Regierung, kritischer Infrastruktur und Software-Wartung. Dieser Artikel behandelt nur das öffentlich verfügbare Flash, nicht die unveröffentlichten Defense-Schnittstellen.
Die DeepMind-Modellkarte nennt als Wissensstand meist März 2026; einzelne Bereiche bleiben bei Januar 2025 (wie die Gemini-3-Familie). Hohe Aufwandstufen können langsamer sein, eher in Timeouts laufen und mehr Token verbrauchen. Das ist kein Kleingedrucktes, sondern eine harte Randbedingung für Latenz- und Kostenplanung.
Google hat 3.8 Flash außerdem als Standardmodell für Antigravity Agent und Antigravity SDK gesetzt. Neue gehostete Agent-Projekte rufen es auf, wenn die Konfiguration nicht geändert wird.
Funktionen: Kontext, Thinking-Stufen und integrierte Tools
Laut der Dokumentation zu den neuesten Gemini-Modellen lassen sich die öffentlichen Fähigkeiten in eine Spezifikationstabelle pressen:
| Spezifikation | Gemini 3.8 Flash |
|---|---|
| Modell-ID | gemini-3.8-flash (stabil / GA) |
| Eingabeobergrenze | 1,048,576 Token (ca. 1M) |
| Maximale Ausgabe | 65,536 Token (in der Doku auch 64K) |
| Thinking-Stufen | low / medium (Standard) / high; minimal löst einen Fehler aus |
| Eingabemodalitäten | Text, Bild, Video, Audio, PDF |
| Ausgabemodalität | Text |
| Abrechnungsmodus | Standard, Batch, Flex, Priority |
Welche Thinking-Stufe wählen
Der zentrale Regler von 3.8 Flash ist thinking_level, nicht ein anderer Modellname. Offizielle Empfehlung, so verstanden:
- low: latenzsensitiv, Entwürfe, Klassifikation, einfache Umschreibungen. Geringster Token-Aufwand.
- medium (Standard): die meisten komplexen Code- und Agent-Schleifen. Die Trefferquote im ersten Durchlauf ist meist besser.
- high: tiefes Reasoning, Mathematik, schwierige mehrstufige Orchestrierung. Das Modell geht mehr Reasoning-Schritte und ruft mehr Tools auf.
Google selbst sagt: 3.8 Flash „arbeitet härter“ (works harder). Bei komplexen Aufgaben macht es zusätzliche Schritte und wiederholt Tool-Aufrufe — auf high besonders deutlich. Unabhängige Messungen: Output-Token pro Aufgabe auf high können rund 30 % über 3.7 Flash liegen — der Einzelpreis bleibt, die Kosten pro Aufgabe steigen trotzdem. Produktions-Routing sollte die Stufe pro Aufgabentyp festlegen, nicht global high.
Integrierte Tools und Eingabemodalitäten
3.8 Flash übernimmt die Tool-Fläche von Gemini 3: Kontext-Cache, Codeausführung, Dateisuche, Function Calling, Structured Output, Search-Grounding, Maps-Grounding, URL-Kontext; Computer Use bleibt Preview. Für Agents heißt das: „Modell + gehostete Tools“ kann zuerst laufen, bevor Sie entscheiden, welche Aktionen in Ihre eigenen Funktionen zurückmüssen.
Multimodale Eingabe eignet sich dafür, Design-Mockups, Fehler-Screenshots, Meeting-Aufnahmen oder PDF-Spezifikationen in dieselbe Agent-Aufgabe zu stecken. Die Ausgabe bleibt Text — die Übergabe an Fachsysteme braucht weiterhin Structured Output oder Ihre eigene Schema-Validierung, statt darauf zu hoffen, dass das Modell „nebenbei“ eine Oberfläche zeichnet.
Wenn Sie noch von generateContent auf die Interactions API umziehen, sollten Sie Schnittstellen- und Zustandsschicht zuerst trennen, bevor Sie den Modellnamen tauschen. Zur Reihenfolge: Nachdem die Gemini API 2026 aktualisiert wurde: welche Schicht Agents zuerst ändern.
Leistung: offizielle Benchmarks und der Preis fürs „Härterarbeiten“
Google betont, 3.8 Flash komme auf mehreren öffentlichen Benchmarks an teurere Frontier-Modelle heran oder übertreffe sie — bei Flash-Preis:
- DeepSWE v1.1 (langlebiges Software Engineering): offiziell besser als die meisten größeren Frontier-Modelle; Dritttabellen nennen oft etwa 73.7%–73.8%. OpenAIs Selbstangabe für GPT-6 Astra: 74.1%. Beide liegen auf demselben mini-swe-agent-Framework sehr nah beieinander; 0.3 Prozentpunkte entscheiden nichts.
- HLE-Verified (interdisziplinäres mehrstufiges Reasoning): offiziell 54.9%.
- Professionelle Agents: Vals Finance Agent V2, Harvey Legal Agent und andere — Google nennt sie besser als 3.7 Flash und weitere Frontier-Modelle. Das sind vom Hersteller gewählte Szenarien: Richtungssignal, kein Regressionsset Ihres Repos.
Der Intelligence Index von Artificial Analysis setzt GPT-6 Astra eine Stufe höher (niedrige Thinking-Stufe ca. 57 vs. 52; hohe Stufen in Berichten oft 59–67, die Methodik ist nicht einheitlich). Für Engineering-Teams zählt: Die Bestehensquote von Programmier-Agents liegt bereits in einem schmalen Band; die Rechnung trennen Token-Verbrauch und Einzelpreis.
DeepSWE, HLE und GPQA hängen von Evaluations-Scaffold, Thinking-Stufe und Tool-Schaltern ab. Anderes Repo, andere Timeout-Strategie — und die Platzierung bewegt sich. Vor dem Go-live 20–50 eigene Regressionsaufgaben gegen 3.7 Flash, 3.8 Flash und Astra laufen lassen: Bestehensquote, thoughtsTokenCount, Wall-Clock-Zeit und Dollar-Kosten protokollieren.
Preise: Einführungsphase, Erhöhung 2027 und Abrechnungsfallen
Die folgende Tabelle folgt den von Google veröffentlichten 3.8-Flash-Einzelpreisen, Einheit jeweils USD / Million Token. Einführungsphase bis 31. Dezember 2026; ab 1. Januar 2027 verdoppelt sich der Standardpreis.
| Modus | Input (bis 2026-12-31) | Output (bis 2026-12-31) | Input (ab 2027-01-01) | Output (ab 2027-01-01) |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $1.50 | $7.50 |
| Batch / Flex | $0.375 | $1.875 | $0.75 | $3.75 |
| Priority | $1.35 | $6.75 | $2.70 | $13.50 |
Drei leicht übersehene Punkte:
- Thinking-Token = Output-Token.
thoughtsTokenCountin der Antwort geht mit $3.75/M (Einführungsphase) auf die Rechnung. Eine High-Stufe-Aufgabe „sieht aus wie 2K Wörter“, hat aber oft schon zehntausende Thinking-Token erzeugt. - Kontext-Cache, Search- / Maps-Grounding extra. Cache hat Schreib- und Speichergebühren, 2027 ebenfalls Anpassung; Grounding-Retrieval wird nach dem Freikontingent pro Request berechnet.
- 3.7 Flash bleibt verfügbar. Wenn Latenz und Token-Aufwand wichtiger sind als Trefferquote, rät Google ausdrücklich, bei 3.7 zu bleiben oder 3.8 auf
lowzu sperren.
Grobe Rechnung für eine Agent-Programmiersitzung: 80,000 Input-Token (Repo-Zusammenfassung + Verlauf + Tool-Rückgaben), 20,000 Output inklusive Thinking. Einführungsphase Standard ca. $0.06 + $0.075 = $0.135. Dieselbe Sitzung über GPT-6 Astra Standard (≤272K Input) etwa $0.80 + $1.00 = $1.80 — rund das 13-Fache. Das ist noch ohne den Aufpreis, den Astra nach über 272K Input auf die gesamte Rechnung legt.
Abos, API-Überverbrauch und Cloud-Mac zusammen in der Monatsrechnung: Was KI-Programmierung im Monat wirklich kostet; Aufschläge von Multi-Modell-Gateways: OpenRouter-API-Preisvergleich.
API: Modell-ID, Interactions und generateContent
3.8 Flash hat zwei Schnittstellen. Für neue Projekte empfiehlt Google die Interactions API (POST /v1beta/interactions); bestehender Code hängt meist noch an generateContent. Beide akzeptieren dieselbe Modell-ID.
curl -X POST https://generativelanguage.googleapis.com/v1beta/interactions \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Summarize the failing test and propose a patch.",
"generation_config": { "thinking_level": "medium" }
}'
Der Bestandspfad ist POST /v1beta/models/gemini-3.8-flash:generateContent. Beim Umzug nicht nur den String ändern: Interactions setzt mit previous_interaction_id fort, generateContent setzt den Verlauf meist selbst zusammen. Tool-Schleifen, Streaming-Events und call_id-Rückgaben brauchen Regression.
In der Produktion vier Dinge festnageln:
- In der Konfiguration
gemini-3.8-flashfest eintragen, nicht auf den Alias „neuestes Flash“ setzen — sonst stiller Generationswechsel. thinking_levelpro Route setzen: Support-Entwürfelow, Repo-Änderungenmedium, Mathematik / Planunghigh.- Logs parallel
usageundthoughtsTokenCount— sonst stimmt die Monatsrechnung nicht. - Structured Output für das finale JSON, Function Calling für Zwischenschritte — nicht in einem Schema vermischen.
Consumer-Einstieg: Gemini App und Search AI Mode; Produktions-Agents über Gemini API oder Gemini Enterprise, mit eigener Schlüssel-, Kontingent- und Aufbewahrungssteuerung. Der serverseitige Zustand von Interactions hat eine Aufbewahrungsfrist; Audit-Logs gehören trotzdem in Ihren Speicher.
Vergleich mit GPT-6 Astra
GPT-6 Astra ist OpenAIs Anfang September 2026 veröffentlichtes Flaggschiff für „die schwierigste End-to-End-Arbeit“: komplexes Reasoning, Programmierung, Computer Use, Research und lange Dokumente. Spezifikation laut OpenAI-Modellseite.
| Dimension | Gemini 3.8 Flash | GPT-6 Astra |
|---|---|---|
| Positionierung | stärkstes Flash-Arbeitspferd / Agent-Standardmodell | Flaggschiff, schwierigste Aufgaben |
| Modell-ID | gemini-3.8-flash |
gpt-6-astra |
| Veröffentlichung | 2026-09-02 (GA) | 2026-09-03 angekündigt, API ca. 09-04 |
| Kontext / maximale Ausgabe | ca. 1.05M / 64K–65K | 1,050,000 / 128,000 |
| Reasoning-Steuerung | thinking_level: low / medium / high |
reasoning.effort: low–max (kein none) |
| Standardpreis (≤ lange-Kontext-Schwelle) | $0.75 / $3.75 (Einführungsphase) | $10 / $50; Cache-Input $1, Schreiben $12.50 |
| Aufpreis bei langem Kontext | öffentliche Tabelle ohne separate 272K-Schwelle | Input >272K: gesamter Auftrag Input/Cache 2×, Output 1.5× |
| Hauptschnittstelle | Interactions API + generateContent | Responses API (breitere Tool-Fläche) |
| Eingabemodalitäten | Text / Bild / Video / Audio / PDF | Text + Bild |
| Wissensstand | meist 2026-03 (teilweise 2025-01) | 2026-04-30 |
| DeepSWE v1.1 | ca. 73.7%–73.8% (Vergleichstabellen) | 74.1% (OpenAI-Selbstangabe) |
Astras Tool-Fläche ist stärker „host-managed“: Websuche, Dateisuche, Bildgenerierung, Code Interpreter, gehostete Shell, Apply Patch, Computer Use, Tool Search. 3.8 Flash punktet bei multimodaler Eingabe, Einführungspreis und Grounding mit Google Suche / Maps / Workspace. Astra schlägt bei sehr langem Input auf den gesamten Auftrag auf; wer ein ganzes Repo oder eine Million-Token-Akte auf einmal reinsteckt, zahlt $20/$75 statt $10/$50.
Batch / Flex liegen auf beiden Seiten bei etwa der Hälfte des Standardpreises; Astra hat zusätzlich Fast (ca. 2×), Gemini das Pendant Priority (ca. 1.8×). Beim Vergleich dieselbe Serviceklasse ausrichten — sonst vergleichen Sie „günstig, aber Warteschlange“ mit „teuer, aber priorisiert“.
Auswahl und Routing
Nicht das „neueste Flaggschiff“ als einziges Default setzen. Stabiler: Aufgaben stufen:
- Standard: 3.8 Flash
medium: alltägliche Codeänderungen, Tickets, Retrieval-Augmentation, die meisten Agent-Schleifen. Bestes Preis-Leistungs-Verhältnis in der Einführungsphase. - Latenzsensitiv: 3.8 Flash
lowoder 3.7 Flash behalten: Completions, Klassifikation, kurze Antworten. Zuerst p95, dann Bestehensquote. - Schwere Aufgaben: Astra oder 3.8 Flash
high: Refactoring über Repos, Computer Use, punktgenaue Suche in langen Dokumenten, Reports mit 128K Ausgabe. Shadow-Traffic auf Bestehensquote und Dollar vergleichen, dann den Hauptpfad umlegen. - Budget 2027 mit $1.50 / $7.50 neu rechnen. Nach dem Ende des Einführungspreises bleibt 3.8 Flash weit unter Astra, ist aber kein „fast kostenloses Frontier“ mehr.
Die echten Agent-Kosten sitzen oft nicht im Modell, sondern in der Ausführung: Xcode, Signing, Simulatoren und lokale Tool-Schleifen auf dem Mac — Modellrechnung und Maschinenrechnung getrennt halten. Zilmac Cloud-Mac eignet sich, die stabile Apple-Toolchain auf festen Knoten zu belassen und 3.8 Flash oder Astra per API aufzurufen, statt Schlüssel, Signing und GPU-Inferenz auf derselben Maschine zu stapeln.
Häufige Fragen
Sind Gemini 3.8 Flash und Gemini 3.8 Pro dasselbe?
Nein. 3.8 Flash ist das Flash-Arbeitspferd; Google betont „gleich schnell und gleich teuer wie 3.7, stärkeres Reasoning“. Stand Redaktionsschluss (2026-09-08) ist das öffentlich beworbene GA-Modell gemini-3.8-flash. Den Flash-Einführungspreis nicht auf ungeprüfte Pro-Preislisten übertragen.
Lässt sich 3.8 Flash Cyber mit einem normalen Gemini-API-Key aufrufen?
Nicht im Sinne eines gewöhnlichen Entwicklerkontingents. Cyber läuft über Fairwind, für vertrauenswürdige Defense-Stellen. Normale Produktion und Consumer-Szenarien nutzen 3.8 Flash.
Reicht beim Wechsel von 3.7 Flash auf 3.8 die neue Modell-ID?
Die Modell-ID können Sie zuerst tauschen, müssen aber Tool-Schleifen, Structured Output und Thinking-Stufe regressieren. 3.8 kann mehr Tools aufrufen und mehr Thinking-Token ausgeben — Latenz und Rechnung ändern sich. Zuerst 5%–10% Traffic vergleichen, dann vollständig umschalten.
Was ist stärker: Gemini 3.8 Flash oder GPT-6 Astra?
Keine einheitliche Antwort. Auf DeepSWE liegen beide praktisch gleichauf; Astra führt bei manchen Intelligenzindizes und der Tool-Fläche, 3.8 Flash bei Einzelpreis, Multimodalität und Einführungsfenster. Maßstab sind Ihr Regressionsset und Dollar pro Aufgabe — nicht die Folien der Launch-Präsentation.
Fazit in einem Satz
- 3.8 Flash: im Herbst 2026 die preislich starke Default-Wahl für Agent / Programmierung — zuerst
mediumsperren, Thinking-Token im Blick behalten. - Astra: für wirklich schwere Aufgaben, die $10/$50 wert sind; 272K-Schwelle und Cache-Schreibgebühr beachten.
- 2027-01-01: Budget mit verdoppeltem Flash-Preis neu rechnen — den Einführungspreis nicht in Jahresverträge schreiben.
Modelle über die API, Builds auf dem Cloud-Mac
Gemini 3.8 Flash und GPT-6 Astra lösen Inferenz; iOS- / macOS-Pipelines brauchen weiter Xcode, Signing und stabile Knoten. Zilmac Cloud-Mac eignet sich, die Ausführungsumgebung von Agents festzuzurren.
Modell und Maschine getrennt abrechnen, getrennt skalieren. — Cloud-Mac-Tarife ansehen