Wer Agenten, Copilot-Alternativen oder ein eigenes LLM-Gateway baut, kommt an OpenRouter kaum vorbei: ein API-Key, ein model-Parameter — und Sie wechseln zwischen Claude, GPT, Gemini und über 300 weiteren Modellen. Aber wie setzt sich die Rechnung zusammen? Und wie groß ist der Unterschied zu direkten Calls bei Anthropic, OpenAI oder Google? Anhand der öffentlichen Preise vom Juli 2026 erklären wir die Billing-Formel, versteckte Kosten und die echten Kosten pro API-Call der drei großen Anbieter.
OpenRouter-Billing: die Formel in einer Minute
OpenRouter arbeitet mit Prepaid-Guthaben und Token-Abrechnung — ohne monatliches Flatrate-Paket. Die Inference-Kosten pro API-Call sind:
Inference-Kosten pro Call
Kosten = (Input-Tokens ÷ 1.000.000 × Input-Preis) + (Output-Tokens ÷ 1.000.000 × Output-Preis)
Preise sind in USD pro Million Tokens angegeben und stehen im OpenRouter-Modellkatalog sowie auf den Detailseiten. Input und Output werden getrennt berechnet; Output ist in der Regel teurer.
Was zählt als Input-Token? Ihr Prompt, System-Prompt, Chat-Verlauf, Tool-Returns (Function Calling), die in den Kontext geschrieben werden, sowie bei manchen Modellen Reasoning-Tokens auf der Input-Seite.
Was zählt als Output-Token? Vom Modell generierter Text (und ggf. separat abgerechnete Reasoning-Outputs).
Beispiel: Modell mit $3/M Input und $15/M Output, ein Request mit 10.000 Input- und 2.000 Output-Tokens:
- Input: 10.000 ÷ 1.000.000 × $3 = $0.03
- Output: 2.000 ÷ 1.000.000 × $15 = $0.03
- Inference gesamt: $0.06 (ohne Top-up-Gebühr)
Die OpenRouter-API ist OpenAI Chat Completions-kompatibel; in der Response finden Sie meist usage.prompt_tokens und usage.completion_tokens — ideal für Live-Kostenschätzung in der App.
Versteckte Kosten, die leicht übersehen werden
Die Token-Preise im Katalog sind nur die Basis. Laut OpenRouter Pricing kommen noch weitere Ebenen dazu:
| Kostenebene | Satz / Regel | Wann fällig |
|---|---|---|
| Inference (Tokens) | Herstellerpreis 1:1 | Jeder API-Call |
| Kreditkarten-Plattformgebühr | 5.5% (Mindestgebühr) | Bei jedem Karten-Top-up |
| Krypto-Top-up | ca. 5% | Bei Krypto-Zahlung |
| BYOK-Überziehung | 5% des OpenRouter-Äquivalents | Eigener Key, > kostenloses Monatskontingent (Standard ca. 1 Mio. Requests/Monat) |
| Volume-Rabatt | bis ca. 7% Rabatt | Gold / Platinum (Schwellen ca. $1K / $5K/Monat) |
Kleine Teams sollten auf Inference noch 5–7% Overhead einplanen. Bei $100 Top-up bleiben nach 5.5% Plattformgebühr etwa $94.50 für Inference — danach Token-Abzug nach Modellpreis.
Wichtig: OpenRouter schlägt bei Mainstream-Modellen nicht auf den Token-Preis auf (gleich wie beim Anbieter). Der Mehrpreis liegt eher in Top-up-Reibung und Multi-Model-Komfort — nicht in verstecktem Token-Aufschlag.
Preistabelle 2026: Claude vs. GPT-5 vs. Gemini
Stand Juli 2026 auf OpenRouter (USD / Mio. Tokens). Preise ändern sich — vor dem Go-live Live-Preise prüfen.
Anthropic Claude
| Modell (OpenRouter-ID) | Input / Mio. | Output / Mio. | Einsatz |
|---|---|---|---|
Claude Opus 5 anthropic/claude-opus-5 |
$5.00 | $25.00 | Flagship-Reasoning, komplexe Agenten, lange Coding-Sessions |
Claude Sonnet 4.6 anthropic/claude-sonnet-4.6 |
$3.00 | $15.00 | Tägliches Coding & Produktions-Workhorse |
Claude Haiku 4.5 anthropic/claude-haiku-4.5 |
$1.00 | $5.00 | Klassifikation, Routing, leichte Completions |
Claude auf OpenRouter unterstützt Prompt Caching: wiederholte große Kontexte (System-Prompts, lange Docs) senken den effektiven Input-Preis deutlich; „Effective Pricing“ auf der Modellseite kann für manche Nutzer 60–80% unter dem Listenpreis liegen.
OpenAI GPT-5
| Modell (OpenRouter-ID) | Input / Mio. | Output / Mio. | Einsatz |
|---|---|---|---|
GPT-5.5 openai/gpt-5.5 |
$5.00 | $30.00 | Flagship multimodal & schwere Tasks |
GPT-5.4 openai/gpt-5.4 |
$2.50 | ca. $10–15 | Balance Performance/Kosten |
GPT-5.4 Mini openai/gpt-5.4-mini |
ca. $0.15–0.40 | ca. $0.60–1.60 | Hohe Parallelität, einfache Tasks |
GPT-5 auf OpenRouter hat oft höhere Output-Preise als vergleichbare Claude-Modelle (z. B. GPT-5.5 Output $30 vs. Opus 5 Output $25). Bei langen Outputs (lange Texte, viel Code) kann OpenAI-Flagship teurer werden.
Google Gemini
| Modell (OpenRouter-ID) | Input / Mio. | Output / Mio. | Einsatz |
|---|---|---|---|
Gemini 3.1 Pro google/gemini-3.1-pro-preview |
$2.00 | $12.00 | Langer Kontext, multimodal Pro |
Gemini 3.5 Flash google/gemini-3.5-flash |
ca. $0.10–0.35 | ca. $0.40–1.40 | Niedrige Latenz, hohes Volumen |
Gemini 3 Flash google/gemini-3-flash-preview |
ca. $0.10–0.25 | ca. $0.40–1.00 | Leichte Dialoge & Tool-Calls |
Im „Flagship Pro“-Segment liegt Gemini 3.1 Pro bei ca. 40% Input- und 48% Output-Preis von Claude Opus 5 — auf dem Papier am günstigsten. Ob die Qualität reicht, hängt vom Use Case ab, nicht nur vom Preis.
Vier reale Szenarien im Kostenvergleich
Schätzung pro einzelnem Inference-Call (ohne 5.5% Top-up). Vergleichsmodelle: Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro.
Szenario A: Kurzer Dialog (Support / Q&A)
ca. 2.000 Input + 500 Output Tokens.
| Modell | Input | Output | Gesamt |
|---|---|---|---|
| Sonnet 4.6 ($3 / $15) | $0.006 | $0.0075 | $0.0135 |
| GPT-5.4 ($2.5 / $12) | $0.005 | $0.006 | $0.011 |
| Gemini 3.1 Pro ($2 / $12) | $0.004 | $0.006 | $0.010 |
Bei kurzen Dialogen sind die Unterschiede gering; selbst bei 10.000 Calls/Tag bleiben die Beträge niedrig.
Szenario B: Code Review (mittlerer Kontext)
ca. 50.000 Input (Diff + relevante Dateien) + 2.000 Output (Review-Kommentare).
| Modell | Gesamt |
|---|---|
| Sonnet 4.6 | $0.18 ($0.15 + $0.03) |
| GPT-5.4 | $0.149 |
| Gemini 3.1 Pro | $0.124 |
Szenario C: Terminal-Agent, eine Session (Repo-intensiv)
ca. 200.000 Input + 10.000 Output — nahe an einer tiefen Claude Code / Cursor-Agent-Runde.
| Modell | Gesamt |
|---|---|
| Sonnet 4.6 | $0.75 |
| GPT-5.4 | $0.62 |
| Gemini 3.1 Pro | $0.52 |
| Claude Opus 5 ($5 / $25) | $1.25 |
| GPT-5.5 ($5 / $30) | $1.30 |
Bei Agenten treiben Input-Tokens die Rechnung. 20 solcher Sessions/Tag mit Sonnet 4.6 ≈ $15/Tag ≈ $450/Monat nur Inference — ein Grund, warum viele zuerst ein Abo wählen (z. B. Claude Code Max), bis die API günstiger wird.
Szenario D: Batch-Zusammenfassung (100 × 8K Input + 300 Output)
Gesamt 800.000 Input + 30.000 Output Tokens.
- Sonnet 4.6: ca. $2.85
- GPT-5.4: ca. $2.36
- Gemini 3.1 Pro: ca. $1.96
- Mit Gemini 3.5 Flash: oft eine Größenordnung günstiger — für Pipelines mit niedrigeren Qualitätsanforderungen
Monatliche Nutzung: wer ist am günstigsten?
Annahme: 50M Input + 5M Output Tokens/Monat (typisch für ein mittelgroßes Agent-Produkt):
| Modell | Monatliche Inference (Schätzung) |
|---|---|
| Claude Opus 5 | $50×5 + $25×5 = $375 |
| Claude Sonnet 4.6 | $3×50 + $15×5 = $225 |
| GPT-5.5 | $5×50 + $30×5 = $400 |
| GPT-5.4 | $2.5×50 + $12×5 = $185 |
| Gemini 3.1 Pro | $2×50 + $12×5 = $160 |
Mit 5.5% Top-up: Gemini 3.1 Pro ca. $169/Monat, Sonnet 4.6 ca. $237/Monat, GPT-5.5 ca. $422/Monat. Auf dem Papier gewinnen oft Gemini Pro oder Flash; für Coding-Agenten bleibt Sonnet für viele Teams der Qualitätsanker.
Vergleich mit Abo-Produkten
Claude Pro (ca. $20/Monat) oder Max 5x ($100/Monat) inkl. Claude Code und Web-Nutzungspool — das ist nicht dasselbe wie API-Token-Billing. Liegt Ihre API-Rechnung stabil über $100–200 und Sie brauchen kein Claude Code, ist OpenRouter + freie Modellwahl oft flexibler; schwere Terminal-Agent-Nutzer profitieren eher vom Abo.
OpenRouter vs. direkte API
| Dimension | OpenRouter | Direkt Anthropic / OpenAI / Google |
|---|---|---|
| Token-Preis (Mainstream) | Meist identisch mit Anbieter | Listenpreis; Enterprise-Rabatte möglich |
| Zusätzliche Plattformgebühr | 5.5% Top-up u. a. | Keine (oder Rechnungsstellung) |
| Multi-Model-Wechsel | model ändern |
Mehrere SDKs, Keys, Billing-Konten |
| Failover / Routing | Integriert | Selbst bauen |
| Compliance & Data Residency | Traffic über OpenRouter — DPA prüfen | Region & Compliance-Pakete wählbar |
Empfehlung: Ein Modell, > $5K/Monat, Enterprise-Rabatt verhandelbar → direkte API. Prototyp, Multi-Model-A/B, kleines Team mit einem Gateway → OpenRouter-Zeitersparnis oft > 5% Gebühr.
Kosten senken: Caching, Batch & Routing
- Prompt Caching: Wiederholte lange System-Prompts bei Claude — OpenRouter leitet Cache-Rabatte durch.
- Model Routing: Haiku / Flash für Intent & Drafts, Sonnet / Pro nur für schwere Schritte — Ø-Preis oft >50% niedriger.
- Kontext komprimieren: Weniger Dateien pro Agent-Runde, Verlauf zusammenfassen — oft wirksamer als Modellwechsel.
- Batch API: Nicht-echtzeitliche Jobs über Anbieter-Batch (teilweise auf OpenRouter geroutet) — deutliche Rabatte.
- Usage monitoren:
prompt_tokens/completion_tokenspro Feature loggen — vermeidet „niemand weiß, wer verbrennt“.
Läuft Ihr Agent zusätzlich xcodebuild, Signing und TestFlight auf dem Mac, kommen Runtime-Kosten dazu. Siehe Cloud Mac & iOS-Toolchain — Build-Umgebung und API-Budget getrennt planen.
FAQ
Kann ich OpenRouter-Gratismodelle produktiv nutzen?
Es gibt kostenlose Modelle und Kontingente mit Rate Limits (RPM, Tageslimits, abhängig vom Guthaben). Gut zum Testen; Produktion braucht bezahlte Modelle und Credits-Budget.
Warum weicht meine Rechnung vom Rechner ab?
Häufig: Reasoning-Tokens nicht mitgerechnet, Tool-Returns im Kontext, Sonderpreise für Bild/Audio, Cache Hit/Miss. Maßgeblich ist usage in der API-Response.
Spart BYOK (eigener API-Key) Geld?
Ca. 1 Mio. BYOK-Requests/Monat kostenlos; darüber 5% des OpenRouter-Äquivalents. Mit bestehendem Enterprise-Rabatt beim Anbieter vermeiden Sie doppeltes OpenRouter-Guthaben — Routing-Gebühr bleibt.
Claude, GPT-5 oder Gemini in 2026?
Kein Universalrezept: Coding & Agent-Qualität → Sonnet / Opus oder GPT-5.4 als Benchmark; langer Kontext + kostenbewusst → Gemini 3.1 Pro; hohe Parallelität, leichte Tasks → Flash / Mini. Zwei Wochen paralleles A/B auf OpenRouter schlägt jede Preistabelle.
Kurzfassung
- Billing: Input + Output getrennt; bei Agenten oft dominiert Input
- Plattform: Top-up ca. +5.5% — Budget nicht nur nach Modellpreis
- Flagship: Gemini 3.1 Pro meist günstigster Listenpreis; GPT-5.5 Output am teuersten
- Wahl: Multi-Model / schnelle Iteration → OpenRouter; ein Modell, hohes Volumen → direkt + Enterprise
API für Modelle, Cloud Mac für Builds
OpenRouter löst „welches LLM“; iOS-/macOS-Pipelines brauchen trotzdem Xcode. Zilmac Cloud Mac passt zu Agent-Workflows — Signing, Notarisierung, TestFlight.
Kein physischer Mac nötig für eine stabile Apple-Toolchain. — Cloud-Mac-Angebote ansehen