
Coût API LLM : batch API, prompt caching et projection mensuelle
Réduisez la facture OpenAI/Anthropic/Gemini : estimez input/output, activez batch et caching dans vos calculs — tarifs vérifiés, 100 % local.
Du décompte de tokens à la facture API du mois
Les tokens d'entrée et de sortie sont facturés à des tarifs par million différents. Compter les tokens donne un volume ; cela ne dit pas si le Batch API, le prompt caching ou la fréquence d'appels dominera la facture. Ce guide commence là où s'arrête le guide de comptage des tokens : transformer les comptes en leviers USD. Sur FastMinify, le calculateur de tarification LLM applique une table datée llm-models.json dans le navigateur — c'est un planificateur, pas une autorité de facturation. Complétez avec le compteur de tokens LLM si vous avez encore besoin d'un décompte Exact ou Estimate. Le hub outils IA & LLM rassemble le reste du cluster.
Erreurs fréquentes : confondre le planificateur et la facture
Les remises batch varient selon l'éditeur, le modèle et les contraintes du job. Le toggle FastMinify est un modèle v1 simplifié pour voir la forme de l'économie — pas un devis.
À retenir — Lisez la date vérifiée sur le calculateur, puis confirmez l'éligibilité batch et le % dans la doc fournisseur avant de briefer la finance.
L'économie cache ne s'applique qu'à la tranche qui touche vraiment le cache. Si vous tapez 80 % caché sur un prompt utilisateur unique, l'estimé est bas et la prod ne le sera pas.
À retenir — Partez de 0 token caché, puis n'augmentez que pour un préfixe stable documenté (system, outils, contexte figé).
Le ×30 suppose que chaque jour ressemble à aujourd'hui. Remises de compte, retries en échec et prix régionaux n'entrent jamais dans cette formule.
À retenir — Utilisez Par mois (30 jours) pour classer des options ; réconciliez la dépense sur le tableau de bord du fournisseur. L'outil ne collera pas à la facture au centime.
Un compteur de mots ou le tokenizer d'un autre modèle fausse les USD. Claude et Gemini sont en palier Estimate (±5–15 %) sur FastMinify, pas des chiffres officiels fournisseur.
À retenir — Comptez d'abord sur le modèle cible dans le compteur de tokens LLM, puis reportez entrée/sortie dans le calculateur de prix.
Limites honnêtes et usage des chiffres
Les tarifs vivent dans un fichier llm-models.json maintenu à la main, revu au moins une fois par mois. La date vérifiée de l'outil reflète cette revue.
Le calculateur est un planificateur indicatif pour des factures de type chat/completion.
Tous les calculs et la dérivation optionnelle de tokens tournent dans le navigateur. FastMinify n'appelle pas d'API de tarifs fournisseurs et n'uploade pas les prompts.
Quatre leviers USD : entrée, sortie, batch et cache
Les fournisseurs publient un $ / 1M de tokens d'entrée et un $ / 1M de tokens de sortie. FastMinify calcule localement (tokens / 1 000 000) × $/1M pour le modèle choisi. Les completions sont souvent plusieurs fois plus chères par token que les prompts — une question courte avec une longue réponse peut coûter plus qu'un gros collage RAG suivi d'un paragraphe. Les tokens de sortie ne sont pas dérivés automatiquement en v1 : saisissez-les depuis les logs ou selon ce que vous attendez du modèle.
Les endpoints batch échangent de la latence contre un tarif plus bas. Le toggle Batch API du calculateur applique une remise plate de 50 % sur le sous-total (USD entrée + sortie avant remise). C'est un modèle v1 simplifié — pas un scrape en direct des grilles batch OpenAI, Anthropic ou Google, ni des fenêtres d'éligibilité. Vérifiez le tarif réel et si votre charge est éligible avant de figer un budget.
Les appels répétés qui partagent un préfixe stable (system prompt, définitions d'outils, corpus RAG figé) peuvent toucher un cache de prompt. FastMinify facture la tranche d'entrée en cache à 10 % du tarif d'entrée du modèle (90 % d'économie sur cette portion seulement). Vous indiquez combien de tokens d'entrée vous attendez depuis le cache — l'outil ne simule pas la logique de hit, les TTL ni les longueurs minimales de préfixe du fournisseur.
Quand appels par jour est supérieur à zéro, le calculateur pose l'USD journalier = Total par appel × appels/jour, puis Par mois (30 jours) = journalier × 30. C'est une extrapolation linéaire sur 30 jours : pas de week-ends, pas de saisonnalité, pas de jours de pic. Servez-vous-en pour comparer des modèles ou des leviers, puis réconciliez avec le tableau de bord du fournisseur.
Workflow : compteur de tokens → calculateur de prix → ligne mensuelle
Ouvrez le compteur de tokens LLM. Collez le prompt ou le JSON messages que vous enverrez. Choisissez le même modèle que l'appel API. Copiez le total d'entrée (badge Exact ou Estimate).
Ouvrez le calculateur de tarification LLM. Saisissez les comptes entrée/sortie (ou collez pour dériver l'entrée). Indiquez les tokens de sortie à la main. Activez Batch API, tokens d'entrée en cache et appels par jour. La date vérifiée de la page est la dernière revue de table — pas la date de votre facture.
Vous lancez une synthèse 200k entrée / 2k sortie 50 fois par jour. La moitié de l'entrée est un préfixe system + corpus que vous espérez cacher. Le chat interactif ne peut pas attendre une fenêtre batch.
Baseline de l'appel interactif
Saisissez 200k entrée, 2k sortie, 0 caché, batch off, 50 appels/jour. Lisez Total par appel et Par mois (30 jours).
Ajouter le cache sur le préfixe stable
Réglez l'entrée cachée sur la taille de préfixe réellement réutilisée (pas 100 % du collage). Observez Tokens entrée en cache dans le détail — moins cher que Tokens entrée frais ; la sortie ne change pas. La remise Batch −50 % s'applique ensuite à tout le sous-total, y compris cette tranche déjà réduite.
Passer le job de nuit en batch
Pour le run non interactif, activez Batch API et comparez Par mois (30 jours). Gardez batch off sur le chat sensible à la latence — le −50 % est un planificateur, pas une garantie de délai.
Conclusion
Une estimation utile sépare entrée et sortie, puis teste les leviers Batch API et prompt cache sur des comptes pris sur le modèle cible. Le calculateur FastMinify le fait en local avec une table datée, un −50 % batch v1, l'entrée cachée à 10 % du tarif input, et une ligne mensuelle ×30. Il ne collera pas à la facture au centime — et c'est voulu : planifiez ici, réconciliez sur le tableau de bord du fournisseur. Comptez d'abord les tokens si vous avez encore besoin du volume ; ensuite, tarifez les leviers.
Articles connexes

RAG, agents multi-tours, system prompts : calculez le % de fenêtre utilisée et la marge restante avant d'envoyer à l'API.

Guide honnête : données tabulaires uniformes, workflow convertir → compter → tarifer → contexte ; pas un manifeste de remplacement JSON/YAML.

Avant d'appeler une API LLM : comptez les tokens, estimez le coût USD et vérifiez la fenêtre de contexte — 100 % dans le navigateur, sans envoyer votre prompt.