Coût API LLM : batch API, prompt caching et projection mensuelle

Coût API LLM : batch API, prompt caching et projection mensuelle

Réduisez la facture OpenAI/Anthropic/Gemini : estimez input/output, activez batch et caching dans vos calculs — tarifs vérifiés, 100 % local.

21.08.2026
10 min de lecture
Partager cet article:
llm
pricing
batch-api
prompt-caching
openai
ai
Tutoriel

Du décompte de tokens à la facture API du mois

Les tokens d'entrée et de sortie sont facturés à des tarifs par million différents. Compter les tokens donne un volume ; cela ne dit pas si le Batch API, le prompt caching ou la fréquence d'appels dominera la facture. Ce guide commence là où s'arrête le guide de comptage des tokens : transformer les comptes en leviers USD. Sur FastMinify, le calculateur de tarification LLM applique une table datée llm-models.json dans le navigateur — c'est un planificateur, pas une autorité de facturation. Complétez avec le compteur de tokens LLM si vous avez encore besoin d'un décompte Exact ou Estimate. Le hub outils IA & LLM rassemble le reste du cluster.

Séparer USD entrée vs sortie via (tokens / 1e6) × $/1M
Modéliser un Batch API −50 % simplifié sur le sous-total
Tarifer la tranche d'entrée en cache à 10 % du tarif input
Projeter un total 30 jours à partir des appels par jour
Aucun prompt envoyé à OpenAI, Anthropic ou Google

Erreurs fréquentes : confondre le planificateur et la facture

Prendre le −50 % batch pour votre grille fournisseur

Les remises batch varient selon l'éditeur, le modèle et les contraintes du job. Le toggle FastMinify est un modèle v1 simplifié pour voir la forme de l'économie — pas un devis.

À retenirLisez la date vérifiée sur le calculateur, puis confirmez l'éligibilité batch et le % dans la doc fournisseur avant de briefer la finance.

Saisir des tokens cachés que vous n'avez jamais mesurés

L'économie cache ne s'applique qu'à la tranche qui touche vraiment le cache. Si vous tapez 80 % caché sur un prompt utilisateur unique, l'estimé est bas et la prod ne le sera pas.

À retenirPartez de 0 token caché, puis n'augmentez que pour un préfixe stable documenté (system, outils, contexte figé).

Lire la ligne mensuelle comme une facture

Le ×30 suppose que chaque jour ressemble à aujourd'hui. Remises de compte, retries en échec et prix régionaux n'entrent jamais dans cette formule.

À retenirUtilisez Par mois (30 jours) pour classer des options ; réconciliez la dépense sur le tableau de bord du fournisseur. L'outil ne collera pas à la facture au centime.

Tarifer les mauvais comptes de tokens

Un compteur de mots ou le tokenizer d'un autre modèle fausse les USD. Claude et Gemini sont en palier Estimate (±5–15 %) sur FastMinify, pas des chiffres officiels fournisseur.

À retenirComptez d'abord sur le modèle cible dans le compteur de tokens LLM, puis reportez entrée/sortie dans le calculateur de prix.

Limites honnêtes et usage des chiffres

Table datée, pas une API de prix en direct

Les tarifs vivent dans un fichier llm-models.json maintenu à la main, revu au moins une fois par mois. La date vérifiée de l'outil reflète cette revue.

Les tarifs liste changent sans préavis sur les sites fournisseurs — revérifiez avant une grosse dépense
Remises de compte, crédits et prix régionaux hors scope
Les litiges se règlent sur le tableau de bord du fournisseur, pas ici
Le $/1M personnalisé est le chemin d'hypothèse si vous avez un tarif contrat
USD uniquement en v1
Ce que la v1 ne modélise pas

Le calculateur est un planificateur indicatif pour des factures de type chat/completion.

Pas de règles embeddings, image, audio ou tool-call
Pas de simulation de TTL cache, de pinning de préfixe ou de hit-rate fournisseur
Le −50 % batch n'est pas la matrice batch publiée de chaque éditeur
Comptes Estimate : ±5–15 % — ne budgétez pas au dernier dollar sur Estimate seul
Les tokens de sortie restent manuels — le champ collage ne devine pas les completions
Confidentialité

Tous les calculs et la dérivation optionnelle de tokens tournent dans le navigateur. FastMinify n'appelle pas d'API de tarifs fournisseurs et n'uploade pas les prompts.

Adapté aux prompts propriétaires et specs internes
Pas de compte requis pour estimer
Plafond 512 KiB — découpez les très gros exports
Instrumentez les usage tokens fournisseur en production comme source de vérité
Workflow hub : compteur de tokens → calculateur de prix → calculateur de fenêtre de contexte si le prompt risque aussi le dépassement

Quatre leviers USD : entrée, sortie, batch et cache

Entrée vs sortie : deux compteurs, deux tarifs

Les fournisseurs publient un $ / 1M de tokens d'entrée et un $ / 1M de tokens de sortie. FastMinify calcule localement (tokens / 1 000 000) × $/1M pour le modèle choisi. Les completions sont souvent plusieurs fois plus chères par token que les prompts — une question courte avec une longue réponse peut coûter plus qu'un gros collage RAG suivi d'un paragraphe. Les tokens de sortie ne sont pas dérivés automatiquement en v1 : saisissez-les depuis les logs ou selon ce que vous attendez du modèle.

Sous-total = entrée fraîche + entrée en cache + sortie ; la remise Batch −50 % s'applique à ce sous-total
Collez un prompt pour dériver les tokens d'entrée via le même countTokensAsync que le compteur
Badge Exact (encodages OpenAI) vs Estimate (±5–15 %) pour Claude et Gemini
Utilisez les champs numériques si vous avez déjà l'usage côté fournisseur
512 KiB UTF-8 max par collage sur les outils IA FastMinify
Batch API : un −50 % plat, modèle v1

Les endpoints batch échangent de la latence contre un tarif plus bas. Le toggle Batch API du calculateur applique une remise plate de 50 % sur le sous-total (USD entrée + sortie avant remise). C'est un modèle v1 simplifié — pas un scrape en direct des grilles batch OpenAI, Anthropic ou Google, ni des fenêtres d'éligibilité. Vérifiez le tarif réel et si votre charge est éligible avant de figer un budget.

batch activé → Total par appel = 50 % du total sans batch
La remise s'applique après le calcul entrée/sortie (et cache), sur le sous-total
Jobs de nuit / hors ligne : candidats batch typiques ; un chat temps réel rarement
L'éligibilité et le % réel sont sur le site du fournisseur — pas dans cet outil
Désactivez le toggle pour comparer interactif vs batch à comptes égaux
Prompt caching : 10 % du tarif d'entrée sur la tranche cachée

Les appels répétés qui partagent un préfixe stable (system prompt, définitions d'outils, corpus RAG figé) peuvent toucher un cache de prompt. FastMinify facture la tranche d'entrée en cache à 10 % du tarif d'entrée du modèle (90 % d'économie sur cette portion seulement). Vous indiquez combien de tokens d'entrée vous attendez depuis le cache — l'outil ne simule pas la logique de hit, les TTL ni les longueurs minimales de préfixe du fournisseur.

Le coût « Tokens entrée en cache » utilise 10 % du $/1M d'entrée ; le champ est plafonné pour ne pas dépasser le total d'entrée
Le reliquat d'entrée « fresh » paie le tarif plein
Les tokens de sortie ne sont jamais cachés dans ce modèle v1
Un system prompt stable cache mieux qu'un tour utilisateur unique
Le champ est une hypothèse — pas un taux de hit garanti
Projection mensuelle : appels par jour × 30

Quand appels par jour est supérieur à zéro, le calculateur pose l'USD journalier = Total par appel × appels/jour, puis Par mois (30 jours) = journalier × 30. C'est une extrapolation linéaire sur 30 jours : pas de week-ends, pas de saisonnalité, pas de jours de pic. Servez-vous-en pour comparer des modèles ou des leviers, puis réconciliez avec le tableau de bord du fournisseur.

Exemple : 10 appels/jour → Par mois (30 jours) = Total par appel × 300
Zéro appel/jour → pas de ligne mensuelle (le total par appel reste affiché)
Comparer tous les modèles réutilise les mêmes comptes et options sur le registre
Les tarifs $/1M personnalisés couvrent un contrat ou une hypothèse
USD uniquement en v1 — pas de TVA, d'engagement ni de devise régionale

Workflow : compteur de tokens → calculateur de prix → ligne mensuelle

Étape 1 — Obtenir des tokens d'entrée honnêtes

Ouvrez le compteur de tokens LLM. Collez le prompt ou le JSON messages que vous enverrez. Choisissez le même modèle que l'appel API. Copiez le total d'entrée (badge Exact ou Estimate).

Même pipeline countTokensAsync que le champ collage du calculateur de prix
Exact (OpenAI) vs Estimate (Claude, Gemini) — ne traitez pas Estimate comme parole d'évangile
Le mode messages API ajoute un overhead ChatML vs texte brut
512 KiB max — découpez les dumps RAG trop gros
Le détail tokenizer est dans le guide de comptage lié plus haut
Étape 2 — Appliquer les leviers USD dans le calculateur

Ouvrez le calculateur de tarification LLM. Saisissez les comptes entrée/sortie (ou collez pour dériver l'entrée). Indiquez les tokens de sortie à la main. Activez Batch API, tokens d'entrée en cache et appels par jour. La date vérifiée de la page est la dernière revue de table — pas la date de votre facture.

Détail des coûts : Tokens entrée frais, Tokens entrée en cache, Tokens sortie, Remise Batch API, Total par appel
Batch API −50 % sur le sous-total (v1 simplifié)
Tranche cachée à 10 % du tarif d'entrée
$/1M personnalisé si votre contrat diffère des tarifs liste
Comparer tous les modèles — mêmes comptes, chaque ligne du registre
Scénario — batch RAG de nuit vs chat interactif

Vous lancez une synthèse 200k entrée / 2k sortie 50 fois par jour. La moitié de l'entrée est un préfixe system + corpus que vous espérez cacher. Le chat interactif ne peut pas attendre une fenêtre batch.

1

Baseline de l'appel interactif

Saisissez 200k entrée, 2k sortie, 0 caché, batch off, 50 appels/jour. Lisez Total par appel et Par mois (30 jours).

2

Ajouter le cache sur le préfixe stable

Réglez l'entrée cachée sur la taille de préfixe réellement réutilisée (pas 100 % du collage). Observez Tokens entrée en cache dans le détail — moins cher que Tokens entrée frais ; la sortie ne change pas. La remise Batch −50 % s'applique ensuite à tout le sous-total, y compris cette tranche déjà réduite.

3

Passer le job de nuit en batch

Pour le run non interactif, activez Batch API et comparez Par mois (30 jours). Gardez batch off sur le chat sensible à la latence — le −50 % est un planificateur, pas une garantie de délai.

Conclusion

Une estimation utile sépare entrée et sortie, puis teste les leviers Batch API et prompt cache sur des comptes pris sur le modèle cible. Le calculateur FastMinify le fait en local avec une table datée, un −50 % batch v1, l'entrée cachée à 10 % du tarif input, et une ligne mensuelle ×30. Il ne collera pas à la facture au centime — et c'est voulu : planifiez ici, réconciliez sur le tableau de bord du fournisseur. Comptez d'abord les tokens si vous avez encore besoin du volume ; ensuite, tarifez les leviers.

Estimez le USD par appel et mensuel à partir de vos comptes de tokens

Comptez sur le modèle cible avant de tarifer
Traitez le −50 % batch comme une forme v1, pas un devis
N'augmentez les tokens cachés que pour un préfixe stable mesuré
Lisez Par mois (30 jours) comme une droite 30 jours, pas de la saisonnalité
Vérifiez la date vérifiée, puis la doc fournisseur, avant une grosse dépense
Partager cet article
Partager cet article: