Contar tokens LLM y estimar el coste API en local (OpenAI, Claude, Gemini)

Contar tokens LLM y estimar el coste API en local (OpenAI, Claude, Gemini)

Antes de llamar a una API LLM: cuenta los tokens, estima el coste USD y verifica la ventana de contexto — 100 % en el navegador, sin enviar tu prompt.

14.08.2026
7 min de lectura
Compartir este artículo:
llm
tokens
pricing
openai
anthropic
gemini
ai
Tutorial

¿Por qué contar los tokens antes de llamar a una API LLM?

Cada petición a OpenAI, Anthropic o Google se factura en tokens de entrada y tokens de salida — no en palabras ni en caracteres. Un system prompt largo, ejemplos few-shot o un historial multi-turno consume la ventana de contexto antes incluso de tu pregunta de usuario. Sin medición previa, descubres el desbordamiento en el error 400, o la factura a fin de mes. En FastMinify, el contador de tokens LLM, la calculadora de precios LLM y la calculadora de ventana de contexto corren enteros en tu navegador — tu texto nunca sale del dispositivo. Explora el hub de herramientas IA & LLM para el flujo completo.

Anticipar el coste USD por llamada antes de enviar a la API
Comprobar que prompt + historial caben en la ventana de contexto del modelo
Comparar varios modelos (GPT, Claude, Gemini) sobre el mismo texto
100 % local — ninguna llamada a tokenizers ni APIs de los proveedores
Flujo rápido: pegar, contar, estimar, ajustar — sin cuenta ni instalación

Límites honestos y buenas prácticas

Lo que estas herramientas no sustituyen

FastMinify apunta a la planificación rápida en el navegador — no a la conciliación contable ni a la optimización runtime.

Sin llamadas a las APIs de billing de los proveedores — tarifas de tabla manual, solo USD en v1
Estimate tier (Claude, Gemini): ±5–15 % — no lo uses solo para presupuestos ajustados
Sin reglas de tokens de imagen, audio o tool-call en v1
Output tokens no derivados automáticamente en la pricing calculator v1
La factura real puede incluir descuentos, regiones o matices de cached tokens — comprueba el dashboard del provider
Reducir tokens y coste antes de la llamada

Contar suele revelar grasa evitable en system prompts y contexto duplicado.

Acortar las instrucciones system — cada token se repite en cada petición
Deduplicar el contexto RAG — no reenvíes chunks casi idénticos
Modelo más pequeño para las tareas simples — compara vía Compare all models
Batch API para workloads no sensibles a la latencia — palanca −50 % en la calculadora
Prompt caching para system prompts estables — modela la slice cached por separado
Privacidad y datos sensibles

A diferencia de muchos contadores en línea que envían el texto a un servidor, FastMinify tokeniza en local. Práctico para prompts con código propietario, PII o specs internas.

Ningún log de servidor del contenido pegado — tratamiento client-side únicamente
Sin cuenta requerida — sin correlación identidad ↔ prompt
512 KiB máx. — divide los payloads muy grandes antes de contar
Formatea el JSON messages en local con json-formatter antes del modo API messages
En prod: instrumentar tus logs API (usage tokens que devuelve el provider) como complemento

Tokens, tiktoken y heurísticas: lo que realmente mides

Tokens ≠ palabras ≠ caracteres

Un token puede ser una palabra entera, una sílaba, puntuación o un fragmento. «Desarrollo» puede valer varios tokens según el modelo; «API» a menudo uno solo. Por eso un contador de palabras no sustituye a un contador de tokens para la facturación LLM.

Los proveedores facturan por millón de tokens — input y output tarifados por separado
El modo messages API añade un overhead ChatML (+3 tokens por mensaje, +1 por name, +3 priming de respuesta)
Las tool definitions, el JSON estructurado y los bloques de código cuentan como texto tokenizado
Un prompt idéntico puede variar ligeramente entre modelos — compara en el modelo objetivo
Formatea primero el JSON messages con el formateador JSON para evitar errores de parse
Exact (OpenAI) vs Estimate (Claude, Gemini)

FastMinify carga js-tiktoken bajo demanda para los modelos OpenAI (codificaciones o200k_base o cl100k_base) y muestra el badge Exact. Para Claude y Gemini, Anthropic y Google no publican un tokenizer de navegador — aplicamos una heurística caracteres/token (±5–15 % típico) con el badge Estimate.

Exact — js-tiktoken lazy-load, misma familia de codificaciones que la doc OpenAI
Estimate — heurística conservadora, nunca presentada como facturación oficial
Modo Auto: detección del formato (texto bruto vs array messages JSON)
Modo API messages: array [{"role","content"}] con overhead ChatML
Para un litigio OpenAI byte-exact, compara con el tokenizer oficial OpenAI
Input, output y ventana de contexto

El coste depende de los dos sentidos: prompt (input) y completion (output). La ventana de contexto limita la suma input + output reservado — la calculadora de ventana de contexto resta una reserva de salida (15 % por defecto) para estimar el presupuesto input efectivo.

Input tokens — system prompt, RAG, historial, pregunta de usuario
Output tokens — se introducen a mano en la calculadora de precios (v1 no los deriva del prompt)
Context window — límite publicado por modelo (tabla mantenida a mano en FastMinify)
Estados Safe / Near limit / Won't fit según el % del presupuesto efectivo consumido
RAG voluminoso: contar el contexto inyectado aparte del mensaje de usuario

Flujo en tres herramientas: contar, estimar, comprobar la ventana

Paso 1 — Contar con el LLM token counter

Pega tu prompt o un array messages JSON en el contador de tokens LLM. Máx. 512 KiB UTF-8. Activa Compare all models para ver el recuento sobre todo el registro.

Texto bruto o modo API messages JSON
Badge Exact (OpenAI) o Estimate (Claude, Gemini) por modelo
Visualización BPE token pills solo para los modelos Exact
Recuento local — ningún upload hacia OpenAI, Anthropic o Google
Copiar el recuento para alimentar la calculadora de precios
Paso 2 — Estimar el coste USD

Transfiere input/output tokens a la calculadora de precios LLM, o pega el prompt para derivar los tokens input con el mismo pipeline countTokensAsync. Las tarifas vienen de una tabla llm-models.json revisada a mano — fecha de verificación mostrada en la herramienta.

Desglose input / output / total USD por llamada
Palanca Batch API (−50 % simplificado sobre el subtotal)
Palanca prompt caching — slice cached tarifada al 10 % de la tarifa input
Proyección mensual: llamadas/día × 30 días
Compare all models — tabla de coste para todos los modelos del registro
Paso 3 — Comprobar la ventana de contexto

La calculadora de ventana de contexto reutiliza el mismo pipeline de recuento y compara tu prompt con el presupuesto efectivo (ventana − reserva output). Ideal antes de un agente multi-turno o un pegado RAG grande.

Reserva output configurable (por defecto 15 %)
Estados Safe (<80 %), Near limit (≥80 %), Won't fit (desbordamiento)
Vista por modelo sobre el registro FastMinify
El mismo límite 512 KiB y el mismo tier Exact/Estimate
Encadenar con la pricing calculator una vez confirmado el margen
Escenario — prototipo RAG antes de pasar a prod

Ensamblas system prompt + 20 chunks vectoriales + pregunta de usuario para GPT-4o.

1

Contar el contexto completo

Pega el conjunto (o el array messages) en el contador. Anota input tokens en el modelo objetivo y comprueba el badge Exact vs Estimate.

2

Probar el margen contextual

Abre la calculadora de ventana de contexto con el mismo texto. Si el estado es Near limit o Won't fit, reduce los chunks o pasa a un modelo con ventana más grande.

3

Proyectar el coste mensual

En la calculadora de precios, introduce input tokens, estima output tokens (p. ej. 500), activa caching si el system prompt es estable y multiplica por las llamadas/día previstas.

Conclusión

Contar los tokens antes de la llamada API evita sorpresas de truncado y de factura. Usa el contador LLM para un recuento honesto (Exact OpenAI, Estimate en el resto), la calculadora de ventana de contexto para validar el margen RAG o multi-turno, y después la calculadora de precios para proyectar el coste USD — todo en el navegador, sin enviar tu prompt a los proveedores.

Contar en el modelo objetivo — los tokens varían entre familias
Tratar Estimate como planificación, no facturación oficial Claude/Gemini
Reservar un margen output en la calculadora de ventana de contexto
Comprobar la fecha de las tarifas en la pricing calculator antes de presupuestos grandes
Encadenar word-counter para el SEO de texto, token counter para la facturación LLM
Compartir este artículo
Compartir este artículo: