Zilmac Blog
← Zurück zur Tech-Praxis

OpenRouter API Preise: Claude, GPT-5, Gemini – echter Kostenvergleich (2026)

API & Agents ·~12 Min. Lesezeit

Multi-Modell-API-Gateway und Cloud-Token-Abrechnung—OpenRouter für Claude GPT Gemini

Wer Agenten, Copilot-Alternativen oder ein eigenes LLM-Gateway baut, kommt an OpenRouter kaum vorbei: ein API-Key, ein model-Parameter — und Sie wechseln zwischen Claude, GPT, Gemini und über 300 weiteren Modellen. Aber wie setzt sich die Rechnung zusammen? Und wie groß ist der Unterschied zu direkten Calls bei Anthropic, OpenAI oder Google? Anhand der öffentlichen Preise vom Juli 2026 erklären wir die Billing-Formel, versteckte Kosten und die echten Kosten pro API-Call der drei großen Anbieter.

5.5%
Plattformgebühr bei Kreditkarten-Top-up (mind. Betrag)
300+
Modelle über einen Endpoint
Input ≠ Output
Zwei Token-Typen, getrennte Preise

OpenRouter-Billing: die Formel in einer Minute

OpenRouter arbeitet mit Prepaid-Guthaben und Token-Abrechnung — ohne monatliches Flatrate-Paket. Die Inference-Kosten pro API-Call sind:

Inference-Kosten pro Call

Kosten = (Input-Tokens ÷ 1.000.000 × Input-Preis) + (Output-Tokens ÷ 1.000.000 × Output-Preis)

Preise sind in USD pro Million Tokens angegeben und stehen im OpenRouter-Modellkatalog sowie auf den Detailseiten. Input und Output werden getrennt berechnet; Output ist in der Regel teurer.

Was zählt als Input-Token? Ihr Prompt, System-Prompt, Chat-Verlauf, Tool-Returns (Function Calling), die in den Kontext geschrieben werden, sowie bei manchen Modellen Reasoning-Tokens auf der Input-Seite.
Was zählt als Output-Token? Vom Modell generierter Text (und ggf. separat abgerechnete Reasoning-Outputs).

Beispiel: Modell mit $3/M Input und $15/M Output, ein Request mit 10.000 Input- und 2.000 Output-Tokens:

  • Input: 10.000 ÷ 1.000.000 × $3 = $0.03
  • Output: 2.000 ÷ 1.000.000 × $15 = $0.03
  • Inference gesamt: $0.06 (ohne Top-up-Gebühr)

Die OpenRouter-API ist OpenAI Chat Completions-kompatibel; in der Response finden Sie meist usage.prompt_tokens und usage.completion_tokens — ideal für Live-Kostenschätzung in der App.

Versteckte Kosten, die leicht übersehen werden

Die Token-Preise im Katalog sind nur die Basis. Laut OpenRouter Pricing kommen noch weitere Ebenen dazu:

Kostenebene Satz / Regel Wann fällig
Inference (Tokens) Herstellerpreis 1:1 Jeder API-Call
Kreditkarten-Plattformgebühr 5.5% (Mindestgebühr) Bei jedem Karten-Top-up
Krypto-Top-up ca. 5% Bei Krypto-Zahlung
BYOK-Überziehung 5% des OpenRouter-Äquivalents Eigener Key, > kostenloses Monatskontingent (Standard ca. 1 Mio. Requests/Monat)
Volume-Rabatt bis ca. 7% Rabatt Gold / Platinum (Schwellen ca. $1K / $5K/Monat)

Kleine Teams sollten auf Inference noch 5–7% Overhead einplanen. Bei $100 Top-up bleiben nach 5.5% Plattformgebühr etwa $94.50 für Inference — danach Token-Abzug nach Modellpreis.

Wichtig: OpenRouter schlägt bei Mainstream-Modellen nicht auf den Token-Preis auf (gleich wie beim Anbieter). Der Mehrpreis liegt eher in Top-up-Reibung und Multi-Model-Komfort — nicht in verstecktem Token-Aufschlag.

Preistabelle 2026: Claude vs. GPT-5 vs. Gemini

Stand Juli 2026 auf OpenRouter (USD / Mio. Tokens). Preise ändern sich — vor dem Go-live Live-Preise prüfen.

Anthropic Claude

Modell (OpenRouter-ID) Input / Mio. Output / Mio. Einsatz
Claude Opus 5 anthropic/claude-opus-5 $5.00 $25.00 Flagship-Reasoning, komplexe Agenten, lange Coding-Sessions
Claude Sonnet 4.6 anthropic/claude-sonnet-4.6 $3.00 $15.00 Tägliches Coding & Produktions-Workhorse
Claude Haiku 4.5 anthropic/claude-haiku-4.5 $1.00 $5.00 Klassifikation, Routing, leichte Completions

Claude auf OpenRouter unterstützt Prompt Caching: wiederholte große Kontexte (System-Prompts, lange Docs) senken den effektiven Input-Preis deutlich; „Effective Pricing“ auf der Modellseite kann für manche Nutzer 60–80% unter dem Listenpreis liegen.

OpenAI GPT-5

Modell (OpenRouter-ID) Input / Mio. Output / Mio. Einsatz
GPT-5.5 openai/gpt-5.5 $5.00 $30.00 Flagship multimodal & schwere Tasks
GPT-5.4 openai/gpt-5.4 $2.50 ca. $10–15 Balance Performance/Kosten
GPT-5.4 Mini openai/gpt-5.4-mini ca. $0.15–0.40 ca. $0.60–1.60 Hohe Parallelität, einfache Tasks

GPT-5 auf OpenRouter hat oft höhere Output-Preise als vergleichbare Claude-Modelle (z. B. GPT-5.5 Output $30 vs. Opus 5 Output $25). Bei langen Outputs (lange Texte, viel Code) kann OpenAI-Flagship teurer werden.

Google Gemini

Modell (OpenRouter-ID) Input / Mio. Output / Mio. Einsatz
Gemini 3.1 Pro google/gemini-3.1-pro-preview $2.00 $12.00 Langer Kontext, multimodal Pro
Gemini 3.5 Flash google/gemini-3.5-flash ca. $0.10–0.35 ca. $0.40–1.40 Niedrige Latenz, hohes Volumen
Gemini 3 Flash google/gemini-3-flash-preview ca. $0.10–0.25 ca. $0.40–1.00 Leichte Dialoge & Tool-Calls

Im „Flagship Pro“-Segment liegt Gemini 3.1 Pro bei ca. 40% Input- und 48% Output-Preis von Claude Opus 5 — auf dem Papier am günstigsten. Ob die Qualität reicht, hängt vom Use Case ab, nicht nur vom Preis.

Entwickler vergleichen Claude-, GPT- und Gemini-API-Rechnungen und Token-Nutzung
In Agent-Szenarien dominieren oft Input-Tokens. Kosten immer mit Input/Output-Verhältnis rechnen — nicht nur den Listenpreis pro Million.

Vier reale Szenarien im Kostenvergleich

Schätzung pro einzelnem Inference-Call (ohne 5.5% Top-up). Vergleichsmodelle: Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro.

Szenario A: Kurzer Dialog (Support / Q&A)

ca. 2.000 Input + 500 Output Tokens.

Modell Input Output Gesamt
Sonnet 4.6 ($3 / $15) $0.006 $0.0075 $0.0135
GPT-5.4 ($2.5 / $12) $0.005 $0.006 $0.011
Gemini 3.1 Pro ($2 / $12) $0.004 $0.006 $0.010

Bei kurzen Dialogen sind die Unterschiede gering; selbst bei 10.000 Calls/Tag bleiben die Beträge niedrig.

Szenario B: Code Review (mittlerer Kontext)

ca. 50.000 Input (Diff + relevante Dateien) + 2.000 Output (Review-Kommentare).

Modell Gesamt
Sonnet 4.6 $0.18 ($0.15 + $0.03)
GPT-5.4 $0.149
Gemini 3.1 Pro $0.124

Szenario C: Terminal-Agent, eine Session (Repo-intensiv)

ca. 200.000 Input + 10.000 Output — nahe an einer tiefen Claude Code / Cursor-Agent-Runde.

Modell Gesamt
Sonnet 4.6 $0.75
GPT-5.4 $0.62
Gemini 3.1 Pro $0.52
Claude Opus 5 ($5 / $25) $1.25
GPT-5.5 ($5 / $30) $1.30

Bei Agenten treiben Input-Tokens die Rechnung. 20 solcher Sessions/Tag mit Sonnet 4.6 ≈ $15/Tag ≈ $450/Monat nur Inference — ein Grund, warum viele zuerst ein Abo wählen (z. B. Claude Code Max), bis die API günstiger wird.

Szenario D: Batch-Zusammenfassung (100 × 8K Input + 300 Output)

Gesamt 800.000 Input + 30.000 Output Tokens.

  • Sonnet 4.6: ca. $2.85
  • GPT-5.4: ca. $2.36
  • Gemini 3.1 Pro: ca. $1.96
  • Mit Gemini 3.5 Flash: oft eine Größenordnung günstiger — für Pipelines mit niedrigeren Qualitätsanforderungen

Monatliche Nutzung: wer ist am günstigsten?

Annahme: 50M Input + 5M Output Tokens/Monat (typisch für ein mittelgroßes Agent-Produkt):

Modell Monatliche Inference (Schätzung)
Claude Opus 5 $50×5 + $25×5 = $375
Claude Sonnet 4.6 $3×50 + $15×5 = $225
GPT-5.5 $5×50 + $30×5 = $400
GPT-5.4 $2.5×50 + $12×5 = $185
Gemini 3.1 Pro $2×50 + $12×5 = $160

Mit 5.5% Top-up: Gemini 3.1 Pro ca. $169/Monat, Sonnet 4.6 ca. $237/Monat, GPT-5.5 ca. $422/Monat. Auf dem Papier gewinnen oft Gemini Pro oder Flash; für Coding-Agenten bleibt Sonnet für viele Teams der Qualitätsanker.

Vergleich mit Abo-Produkten

Claude Pro (ca. $20/Monat) oder Max 5x ($100/Monat) inkl. Claude Code und Web-Nutzungspool — das ist nicht dasselbe wie API-Token-Billing. Liegt Ihre API-Rechnung stabil über $100–200 und Sie brauchen kein Claude Code, ist OpenRouter + freie Modellwahl oft flexibler; schwere Terminal-Agent-Nutzer profitieren eher vom Abo.

OpenRouter vs. direkte API

Dimension OpenRouter Direkt Anthropic / OpenAI / Google
Token-Preis (Mainstream) Meist identisch mit Anbieter Listenpreis; Enterprise-Rabatte möglich
Zusätzliche Plattformgebühr 5.5% Top-up u. a. Keine (oder Rechnungsstellung)
Multi-Model-Wechsel model ändern Mehrere SDKs, Keys, Billing-Konten
Failover / Routing Integriert Selbst bauen
Compliance & Data Residency Traffic über OpenRouter — DPA prüfen Region & Compliance-Pakete wählbar

Empfehlung: Ein Modell, > $5K/Monat, Enterprise-Rabatt verhandelbar → direkte API. Prototyp, Multi-Model-A/B, kleines Team mit einem Gateway → OpenRouter-Zeitersparnis oft > 5% Gebühr.

Kosten senken: Caching, Batch & Routing

  1. Prompt Caching: Wiederholte lange System-Prompts bei Claude — OpenRouter leitet Cache-Rabatte durch.
  2. Model Routing: Haiku / Flash für Intent & Drafts, Sonnet / Pro nur für schwere Schritte — Ø-Preis oft >50% niedriger.
  3. Kontext komprimieren: Weniger Dateien pro Agent-Runde, Verlauf zusammenfassen — oft wirksamer als Modellwechsel.
  4. Batch API: Nicht-echtzeitliche Jobs über Anbieter-Batch (teilweise auf OpenRouter geroutet) — deutliche Rabatte.
  5. Usage monitoren: prompt_tokens / completion_tokens pro Feature loggen — vermeidet „niemand weiß, wer verbrennt“.

Läuft Ihr Agent zusätzlich xcodebuild, Signing und TestFlight auf dem Mac, kommen Runtime-Kosten dazu. Siehe Cloud Mac & iOS-Toolchain — Build-Umgebung und API-Budget getrennt planen.

FAQ

Kann ich OpenRouter-Gratismodelle produktiv nutzen?

Es gibt kostenlose Modelle und Kontingente mit Rate Limits (RPM, Tageslimits, abhängig vom Guthaben). Gut zum Testen; Produktion braucht bezahlte Modelle und Credits-Budget.

Warum weicht meine Rechnung vom Rechner ab?

Häufig: Reasoning-Tokens nicht mitgerechnet, Tool-Returns im Kontext, Sonderpreise für Bild/Audio, Cache Hit/Miss. Maßgeblich ist usage in der API-Response.

Spart BYOK (eigener API-Key) Geld?

Ca. 1 Mio. BYOK-Requests/Monat kostenlos; darüber 5% des OpenRouter-Äquivalents. Mit bestehendem Enterprise-Rabatt beim Anbieter vermeiden Sie doppeltes OpenRouter-Guthaben — Routing-Gebühr bleibt.

Claude, GPT-5 oder Gemini in 2026?

Kein Universalrezept: Coding & Agent-Qualität → Sonnet / Opus oder GPT-5.4 als Benchmark; langer Kontext + kostenbewusst → Gemini 3.1 Pro; hohe Parallelität, leichte Tasks → Flash / Mini. Zwei Wochen paralleles A/B auf OpenRouter schlägt jede Preistabelle.

Kurzfassung

  • Billing: Input + Output getrennt; bei Agenten oft dominiert Input
  • Plattform: Top-up ca. +5.5% — Budget nicht nur nach Modellpreis
  • Flagship: Gemini 3.1 Pro meist günstigster Listenpreis; GPT-5.5 Output am teuersten
  • Wahl: Multi-Model / schnelle Iteration → OpenRouter; ein Modell, hohes Volumen → direkt + Enterprise

API für Modelle, Cloud Mac für Builds

OpenRouter löst „welches LLM“; iOS-/macOS-Pipelines brauchen trotzdem Xcode. Zilmac Cloud Mac passt zu Agent-Workflows — Signing, Notarisierung, TestFlight.

Kein physischer Mac nötig für eine stabile Apple-Toolchain. — Cloud-Mac-Angebote ansehen

Zeitlich begrenzt

Zilmac

Cloud-Mac, Remote-Dev und Mac VPS—Apple-Toolchain für iOS und Cross-Platform-Teams.

Zur Startseite
Zeitlich begrenzt Pläne ansehen