Pour les équipes qui construisent des agents, des alternatives à Copilot ou leur propre passerelle LLM, OpenRouter est presque incontournable : une clé API, un paramètre model, et vous basculez entre Claude, GPT, Gemini et plus de 300 modèles. Mais comment se calcule la facture ? Et quel écart avec les appels directs chez Anthropic, OpenAI ou Google ? À partir des tarifs publics de juillet 2026, nous détaillons la formule de facturation, les coûts cachés et le coût réel par appel API des trois grands fournisseurs.
Facturation OpenRouter : la formule en une minute
OpenRouter fonctionne en prépaiement et facturation au token, sans forfait mensuel. Le cœur du coût d'inference par appel API :
Coût d'inference par appel
Coût = (tokens entrée ÷ 1 000 000 × prix entrée) + (tokens sortie ÷ 1 000 000 × prix sortie)
Les prix sont en USD par million de tokens, visibles dans le catalogue OpenRouter et sur chaque fiche modèle. Entrée et sortie sont facturées séparément ; la sortie coûte généralement plus cher.
Qu'est-ce qu'un token d'entrée ? Votre prompt, le system prompt, l'historique, les retours d'outils (function calling) injectés dans le contexte, et chez certains modèles les tokens de reasoning côté entrée.
Qu'est-ce qu'un token de sortie ? Le texte généré par le modèle (et éventuellement le reasoning facturé à part).
Exemple : modèle à $3/M entrée et $15/M sortie, une requête de 10 000 tokens entrée + 2 000 sortie :
- Entrée : 10 000 ÷ 1 000 000 × $3 = $0.03
- Sortie : 2 000 ÷ 1 000 000 × $15 = $0.03
- Inference totale : $0.06 (hors frais de recharge)
L'API OpenRouter est compatible OpenAI Chat Completions ; la réponse contient en général usage.prompt_tokens et usage.completion_tokens pour estimer les coûts en temps réel.
Coûts cachés à ne pas oublier
Le prix token affiché dans le catalogue n'est qu'un plancher. Selon la page tarifs OpenRouter, d'autres couches s'ajoutent :
| Couche de coût | Taux / règle | Déclencheur |
|---|---|---|
| Inference (tokens) | Prix fournisseur transmis tel quel | Chaque appel API |
| Frais plateforme carte | 5.5% (minimum) | Chaque achat de crédits par carte |
| Recharge crypto | ~5% | Paiement crypto |
| Surplus BYOK | 5% de l'équivalent OpenRouter | Clé perso, requêtes > quota gratuit mensuel (standard ~1 M/mois) |
| Remise volume | jusqu'à ~7% de réduction | Gold / Platinum (seuils ~$1K / $5K/mois) |
Les petites équipes doivent prévoir 5–7% d'overhead en plus de l'inference. Exemple : $100 rechargés → environ $94.50 utilisables en inference (après 5.5%), puis débit au tarif modèle.
Point clé : OpenRouter ne majore pas le prix token des modèles mainstream (aligné sur le fournisseur). Le surcoût vient surtout de la friction de recharge et du confort multi-modèles — pas d'un markup caché par token.
Grille tarifaire 2026 : Claude vs GPT-5 vs Gemini
Tarifs représentatifs sur OpenRouter en juillet 2026 (USD / M tokens). Les chiffres évoluent — vérifiez les prix en direct avant production.
Anthropic Claude
| Modèle (ID OpenRouter) | Entrée / M | Sortie / M | Usage |
|---|---|---|---|
Claude Opus 5 anthropic/claude-opus-5 |
$5.00 | $25.00 | Reasoning flagship, agents complexes, coding long |
Claude Sonnet 4.6 anthropic/claude-sonnet-4.6 |
$3.00 | $15.00 | Coding quotidien et workhorse produit |
Claude Haiku 4.5 anthropic/claude-haiku-4.5 |
$1.00 | $5.00 | Classification, routage, complétions légères |
Claude sur OpenRouter prend en charge le Prompt Caching : les gros contextes répétés (system prompt, longs docs) réduisent fortement le prix effectif d'entrée ; le « Effective Pricing » peut être 60–80% sous le tarif affiché pour certains profils.
OpenAI GPT-5
| Modèle (ID OpenRouter) | Entrée / M | Sortie / M | Usage |
|---|---|---|---|
GPT-5.5 openai/gpt-5.5 |
$5.00 | $30.00 | Flagship multimodal et tâches lourdes |
GPT-5.4 openai/gpt-5.4 |
$2.50 | ~$10–15 | Équilibre performance / coût |
GPT-5.4 Mini openai/gpt-5.4-mini |
~$0.15–0.40 | ~$0.60–1.60 | Forte concurrence, tâches simples |
La série GPT-5 sur OpenRouter affiche souvent des prix de sortie plus élevés que Claude équivalent (ex. GPT-5.5 sortie $30 vs Opus 5 sortie $25). Si votre app génère beaucoup de sortie (longs textes, code), le flagship OpenAI peut coûter plus cher au total.
Google Gemini
| Modèle (ID OpenRouter) | Entrée / M | Sortie / M | Usage |
|---|---|---|---|
Gemini 3.1 Pro google/gemini-3.1-pro-preview |
$2.00 | $12.00 | Long contexte, multimodal Pro |
Gemini 3.5 Flash google/gemini-3.5-flash |
~$0.10–0.35 | ~$0.40–1.40 | Faible latence, gros volumes |
Gemini 3 Flash google/gemini-3-flash-preview |
~$0.10–0.25 | ~$0.40–1.00 | Dialogues légers et tool calls |
En segment « flagship Pro », Gemini 3.1 Pro représente environ 40% du prix entrée et 48% du prix sortie de Claude Opus 5 — le plus compétitif sur le papier. La qualité suffisante dépend du cas d'usage, pas du prix seul.
Quatre scénarios réels chiffrés
Estimation par appel d'inference unique (hors 5.5% de recharge). Modèles de référence : Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro.
Scénario A : dialogue court (support / Q&R)
~2 000 entrée + 500 sortie tokens.
| Modèle | Entrée | Sortie | Total |
|---|---|---|---|
| Sonnet 4.6 ($3 / $15) | $0.006 | $0.0075 | $0.0135 |
| GPT-5.4 ($2.5 / $12) | $0.005 | $0.006 | $0.011 |
| Gemini 3.1 Pro ($2 / $12) | $0.004 | $0.006 | $0.010 |
Écarts faibles sur les courts dialogues ; même à 10 000 appels/jour, les montants restent modestes.
Scénario B : revue de code (contexte moyen)
~50 000 entrée (diff + fichiers) + 2 000 sortie (commentaires).
| Modèle | Total |
|---|---|
| Sonnet 4.6 | $0.18 ($0.15 + $0.03) |
| GPT-5.4 | $0.149 |
| Gemini 3.1 Pro | $0.124 |
Scénario C : agent terminal, une session (lecture intensive du repo)
~200 000 entrée + 10 000 sortie — proche d'une session profonde Claude Code / Cursor Agent.
| Modèle | Total |
|---|---|
| Sonnet 4.6 | $0.75 |
| GPT-5.4 | $0.62 |
| Gemini 3.1 Pro | $0.52 |
| Claude Opus 5 ($5 / $25) | $1.25 |
| GPT-5.5 ($5 / $30) | $1.30 |
En agent, les tokens d'entrée dominent la facture. 20 sessions/jour avec Sonnet 4.6 ≈ $15/jour ≈ $450/mois d'inference seule — d'où l'intérêt d'un abonnement (ex. Claude Code Max) avant que l'API ne devienne plus rentable.
Scénario D : résumés en batch (100 × 8K entrée + 300 sortie)
Total 800 000 entrée + 30 000 sortie tokens.
- Sonnet 4.6 : ~$2.85
- GPT-5.4 : ~$2.36
- Gemini 3.1 Pro : ~$1.96
- Avec Gemini 3.5 Flash : souvent un ordre de grandeur de moins — pour pipelines à exigence qualité modérée
Usage mensuel : le moins cher ?
Hypothèse : 50M entrée + 5M sortie tokens/mois (produit agent de taille moyenne) :
| Modèle | Inference mensuelle (estimation) |
|---|---|
| Claude Opus 5 | $50×5 + $25×5 = $375 |
| Claude Sonnet 4.6 | $3×50 + $15×5 = $225 |
| GPT-5.5 | $5×50 + $30×5 = $400 |
| GPT-5.4 | $2.5×50 + $12×5 = $185 |
| Gemini 3.1 Pro | $2×50 + $12×5 = $160 |
Avec 5.5% de recharge : Gemini 3.1 Pro ~$169/mois, Sonnet 4.6 ~$237/mois, GPT-5.5 ~$422/mois. Sur le papier, Gemini Pro ou Flash gagne souvent ; pour les agents de code, Sonnet reste l'ancre qualité de beaucoup d'équipes.
Comparer aux abonnements
Claude Pro (~$20/mois) ou Max 5x ($100/mois) incluent Claude Code et un pool web — ce n'est pas la facturation API au token. Si votre facture API dépasse stablement $100–200 sans besoin de Claude Code, OpenRouter + modèles au choix est souvent plus flexible ; les gros utilisateurs d'agents terminal peuvent préférer l'abonnement.
OpenRouter vs API directe
| Dimension | OpenRouter | Direct Anthropic / OpenAI / Google |
|---|---|---|
| Prix token (mainstream) | Généralement identique au fournisseur | Tarif liste ; remises entreprise possibles |
| Frais plateforme | 5.5% recharge, etc. | Aucun (ou facturation) |
| Changement de modèle | Modifier model |
Plusieurs SDK, clés, comptes billing |
| Failover / routage | Intégré multi-fournisseur | À construire |
| Conformité et résidence des données | Trafic via OpenRouter — évaluer le DPA | Région et offres conformité au choix |
Conseil : un seul modèle, > $5K/mois, remise entreprise négociable → API directe. Prototype, A/B multi-modèles, petite équipe avec une passerelle → le gain de temps OpenRouter dépasse souvent 5% de frais.
Réduire les coûts : cache, Batch et routage
- Prompt Caching : longs system prompts Claude répétés — OpenRouter transmet les remises cache.
- Routage de modèles : Haiku / Flash pour intent et brouillons, Sonnet / Pro pour les étapes lourdes — prix moyen souvent >50% plus bas.
- Compresser le contexte : limiter les fichiers lus par l'agent, résumer l'historique — souvent plus efficace que changer de flagship.
- Batch API : tâches non temps réel via Batch fournisseur (certains modèles routés sur OpenRouter) — remises importantes.
- Monitorer usage : logger
prompt_tokens/completion_tokenspar feature — évite le « on ne sait pas qui brûle le budget ».
Si l'agent exécute aussi xcodebuild, signature et TestFlight sur Mac, il y a un coût d'environnement d'exécution en plus du modèle. Voir Cloud Mac et toolchain iOS pour séparer build et budget API.
FAQ
Les modèles gratuits OpenRouter sont-ils utilisables en prod ?
Modèles et quotas gratuits existent avec rate limits (RPM, plafonds journaliers, liés au solde). Idéal pour essais ; la prod nécessite modèles payants et budget crédits.
Pourquoi ma facture diffère du calculateur ?
Causes fréquentes : tokens reasoning non comptés, retours d'outils dans le contexte, tarifs spéciaux image/audio, cache hit/miss. Référence : usage dans la réponse API.
BYOK (clé API perso) est-il moins cher ?
~1 M requêtes BYOK/mois gratuites ; au-delà, 5% de l'équivalent OpenRouter. Avec remise entreprise chez le fournisseur, vous évitez de recharger OpenRouter — frais de routage en sus.
Claude, GPT-5 ou Gemini en 2026 ?
Pas de réponse unique : qualité code et agent → Sonnet / Opus ou GPT-5.4 en référence ; long contexte + budget serré → Gemini 3.1 Pro ; forte concurrence, tâches légères → Flash / Mini. Deux semaines d'A/B parallèle sur OpenRouter battent toute grille tarifaire.
En bref
- Facturation : entrée + sortie séparées ; en agent, l'entrée domine souvent
- Plateforme : recharge ~+5.5% — ne budgétez pas sur le seul tarif modèle
- Flagship : Gemini 3.1 Pro souvent le moins cher au catalogue ; sortie GPT-5.5 la plus chère
- Choix : multi-modèles / itération rapide → OpenRouter ; un modèle, gros volume → direct + entreprise
API pour les modèles, Cloud Mac pour les builds
OpenRouter répond à « quel LLM » ; les pipelines iOS/macOS ont toujours besoin de Xcode. Le Cloud Mac Zilmac s'intègre aux workflows agent — signature, notarisation, TestFlight.
Pas de Mac physique pour une toolchain Apple stable. — Voir les offres Cloud Mac