Compter les tokens LLM et estimer le coût API en local (OpenAI, Claude, Gemini)

Compter les tokens LLM et estimer le coût API en local (OpenAI, Claude, Gemini)

Avant d'appeler une API LLM : comptez les tokens, estimez le coût USD et vérifiez la fenêtre de contexte — 100 % dans le navigateur, sans envoyer votre prompt.

14.08.2026
7 min de lecture
Partager cet article:
llm
tokens
pricing
openai
anthropic
gemini
ai
Tutoriel

Pourquoi compter les tokens avant d'appeler une API LLM ?

Chaque requête vers OpenAI, Anthropic ou Google est facturée en tokens d'entrée et tokens de sortie — pas en mots ou en caractères. Un system prompt long, des exemples few-shot ou un historique multi-tours consomme la fenêtre de contexte avant même votre question utilisateur. Sans mesure préalable, vous découvrez le dépassement au moment de l'erreur 400, ou la facture en fin de mois. Sur FastMinify, le compteur de tokens LLM, le calculateur de tarification LLM et le calculateur de fenêtre de contexte tournent entièrement dans votre navigateur — votre texte ne quitte jamais l'appareil. Explorez le hub outils IA & LLM pour le workflow complet.

Anticiper le coût USD par appel avant d'envoyer à l'API
Vérifier que prompt + historique tiennent dans la fenêtre de contexte du modèle
Comparer plusieurs modèles (GPT, Claude, Gemini) sur le même texte
100 % local — aucun appel aux tokenizers ou APIs des fournisseurs
Workflow rapide : coller, compter, estimer, ajuster — sans compte ni installation

Limites honnêtes et bonnes pratiques

Ce que ces outils ne remplacent pas

FastMinify vise la planification rapide dans le navigateur — pas la réconciliation comptable ni l'optimisation runtime.

Pas d'appel aux APIs billing des fournisseurs — tarifs table manuelle, USD uniquement en v1
Estimate tier (Claude, Gemini) : ±5–15 % — ne pas utiliser seul pour des budgets serrés
Pas de règles tokens image, audio ou tool-call en v1
Output tokens non dérivés automatiquement dans le pricing calculator v1
La facture réelle peut inclure remises, régions ou nuances de cached tokens — vérifiez le dashboard provider
Réduire tokens et coût avant l'appel

Compter révèle souvent du gras évitable dans system prompts et contexte dupliqué.

Raccourcir les instructions system — chaque token se répète à chaque requête
Dédoublonner le contexte RAG — ne pas renvoyer des chunks quasi identiques
Modèle plus petit pour les tâches simples — comparez via Compare all models
Batch API pour workloads non latency-sensitive — levier −50 % dans le calculateur
Prompt caching pour system prompts stables — modélisez la slice cached séparément
Confidentialité et données sensibles

Contrairement à de nombreux compteurs en ligne qui envoient le texte à un serveur, FastMinify tokenise localement. Pratique pour des prompts contenant du code propriétaire, des PII ou des specs internes.

Aucun log serveur du contenu collé — traitement client-side uniquement
Pas de compte requis — pas de corrélation identité ↔ prompt
512 KiB max — scinder les très gros payloads avant comptage
Formater le JSON messages localement avec json-formatter avant le mode API messages
Pour la prod : instrumenter vos logs API (usage tokens renvoyés par le provider) en complément

Tokens, tiktoken et heuristiques : ce que vous mesurez vraiment

Tokens ≠ mots ≠ caractères

Un token peut être un mot entier, une syllabe, de la ponctuation ou un fragment. « Développement » peut valoir plusieurs tokens selon le modèle ; « API » souvent un seul. C'est pourquoi un compteur de mots ne remplace pas un compteur de tokens pour la facturation LLM.

Les fournisseurs facturent au million de tokens — input et output tarifés séparément
Le mode messages API ajoute un overhead ChatML (+3 tokens par message, +1 par name, +3 priming réponse)
Les tool definitions, JSON structuré et blocs code comptent comme du texte tokenisé
Un prompt identique peut varier légèrement entre modèles — comparez sur le modèle cible
Formatez d'abord le JSON messages avec le formateur JSON pour éviter les erreurs de parse
Exact (OpenAI) vs Estimate (Claude, Gemini)

FastMinify charge js-tiktoken à la demande pour les modèles OpenAI (encodages o200k_base ou cl100k_base) et affiche le badge Exact. Pour Claude et Gemini, Anthropic et Google ne publient pas de tokenizer navigateur — nous appliquons une heuristique caractères/token (±5–15 % typique) avec le badge Estimate.

Exact — js-tiktoken lazy-load, même famille d'encodages que la doc OpenAI
Estimate — heuristique conservative, jamais présentée comme facturation officielle
Mode Auto : détection du format (texte brut vs tableau messages JSON)
Mode API messages : tableau [{"role","content"}] avec overhead ChatML
Pour un litige OpenAI byte-exact, comparez avec le tokenizer officiel OpenAI
Input, output et fenêtre de contexte

Le coût dépend des deux sens : prompt (input) et completion (output). La fenêtre de contexte limite la somme input + output réservé — le calculateur de fenêtre de contexte soustrait une réserve de sortie (15 % par défaut) pour estimer le budget input effectif.

Input tokens — system prompt, RAG, historique, question utilisateur
Output tokens — saisis manuellement dans le calculateur de prix (v1 ne les dérive pas du prompt)
Context window — limite publiée par modèle (table maintenue manuellement sur FastMinify)
Statuts Safe / Near limit / Won't fit selon le % du budget effectif consommé
RAG volumineux : compter le contexte injecté séparément du message utilisateur

Workflow en trois outils : compter, estimer, vérifier la fenêtre

Étape 1 — Compter avec le LLM token counter

Collez votre prompt ou un tableau messages JSON dans le compteur de tokens LLM. Max 512 KiB UTF-8. Basculez Compare all models pour voir le décompte sur l'ensemble du registre.

Texte brut ou mode API messages JSON
Badge Exact (OpenAI) ou Estimate (Claude, Gemini) par modèle
Visualisation BPE token pills pour les modèles Exact uniquement
Comptage local — aucun upload vers OpenAI, Anthropic ou Google
Copier le décompte pour alimenter le calculateur de prix
Étape 2 — Estimer le coût USD

Transférez input/output tokens dans le calculateur de tarification LLM, ou collez le prompt pour dériver les tokens input via la même pipeline countTokensAsync. Les tarifs proviennent d'une table llm-models.json revue manuellement — date de vérification affichée sur l'outil.

Breakdown input / output / total USD par appel
Levier Batch API (−50 % simplifié sur le sous-total)
Levier prompt caching — slice cached facturée à 10 % du tarif input
Projection mensuelle : appels/jour × 30 jours
Compare all models — tableau coût pour tous les modèles du registre
Étape 3 — Vérifier la fenêtre de contexte

Le calculateur de fenêtre de contexte réutilise la même pipeline de comptage et compare votre prompt au budget effectif (fenêtre − réserve output). Idéal avant un agent multi-tours ou un gros collage RAG.

Réserve output configurable (défaut 15 %)
Statuts Safe (<80 %), Near limit (≥80 %), Won't fit (dépassement)
Vue par modèle sur le registre FastMinify
Même limite 512 KiB et même tier Exact/Estimate
Enchaîner avec le pricing calculator une fois la marge confirmée
Scénario — prototype RAG avant mise en prod

Vous assemblez system prompt + 20 chunks vectoriels + question utilisateur pour GPT-4o.

1

Compter le contexte complet

Collez l'ensemble (ou le tableau messages) dans le compteur. Notez input tokens sur le modèle cible et vérifiez le badge Exact vs Estimate.

2

Tester la marge contextuelle

Ouvrez le calculateur de fenêtre de contexte avec le même texte. Si statut Near limit ou Won't fit, réduisez les chunks ou passez à un modèle à plus grande fenêtre.

3

Projeter le coût mensuel

Dans le calculateur de prix, saisissez input tokens, estimez output tokens (ex. 500), activez caching si le system prompt est stable, puis multipliez par vos appels/jour prévus.

Conclusion

Compter les tokens avant l'appel API évite les surprises de troncature et de facture. Utilisez le compteur LLM pour un décompte honnête (Exact OpenAI, Estimate ailleurs), le calculateur de fenêtre de contexte pour valider la marge RAG ou multi-tours, puis le calculateur de tarification pour projeter le coût USD — le tout dans le navigateur, sans envoyer votre prompt aux fournisseurs.

Compter sur le modèle cible — les tokens varient entre familles
Traiter Estimate comme planification, pas facturation officielle Claude/Gemini
Réserver une marge output dans le calculateur de fenêtre de contexte
Vérifier la date des tarifs sur le pricing calculator avant gros budgets
Enchaîner word-counter pour le SEO texte, token counter pour la facturation LLM
Partager cet article
Partager cet article: