
Contar tokens LLM y estimar el coste API en local (OpenAI, Claude, Gemini)
Antes de llamar a una API LLM: cuenta los tokens, estima el coste USD y verifica la ventana de contexto — 100 % en el navegador, sin enviar tu prompt.
¿Por qué contar los tokens antes de llamar a una API LLM?
Cada petición a OpenAI, Anthropic o Google se factura en tokens de entrada y tokens de salida — no en palabras ni en caracteres. Un system prompt largo, ejemplos few-shot o un historial multi-turno consume la ventana de contexto antes incluso de tu pregunta de usuario. Sin medición previa, descubres el desbordamiento en el error 400, o la factura a fin de mes. En FastMinify, el contador de tokens LLM, la calculadora de precios LLM y la calculadora de ventana de contexto corren enteros en tu navegador — tu texto nunca sale del dispositivo. Explora el hub de herramientas IA & LLM para el flujo completo.
Límites honestos y buenas prácticas
FastMinify apunta a la planificación rápida en el navegador — no a la conciliación contable ni a la optimización runtime.
Contar suele revelar grasa evitable en system prompts y contexto duplicado.
A diferencia de muchos contadores en línea que envían el texto a un servidor, FastMinify tokeniza en local. Práctico para prompts con código propietario, PII o specs internas.
Tokens, tiktoken y heurísticas: lo que realmente mides
Un token puede ser una palabra entera, una sílaba, puntuación o un fragmento. «Desarrollo» puede valer varios tokens según el modelo; «API» a menudo uno solo. Por eso un contador de palabras no sustituye a un contador de tokens para la facturación LLM.
FastMinify carga js-tiktoken bajo demanda para los modelos OpenAI (codificaciones o200k_base o cl100k_base) y muestra el badge Exact. Para Claude y Gemini, Anthropic y Google no publican un tokenizer de navegador — aplicamos una heurística caracteres/token (±5–15 % típico) con el badge Estimate.
[{"role","content"}] con overhead ChatMLEl coste depende de los dos sentidos: prompt (input) y completion (output). La ventana de contexto limita la suma input + output reservado — la calculadora de ventana de contexto resta una reserva de salida (15 % por defecto) para estimar el presupuesto input efectivo.
Flujo en tres herramientas: contar, estimar, comprobar la ventana
Pega tu prompt o un array messages JSON en el contador de tokens LLM. Máx. 512 KiB UTF-8. Activa Compare all models para ver el recuento sobre todo el registro.
Transfiere input/output tokens a la calculadora de precios LLM, o pega el prompt para derivar los tokens input con el mismo pipeline countTokensAsync. Las tarifas vienen de una tabla llm-models.json revisada a mano — fecha de verificación mostrada en la herramienta.
La calculadora de ventana de contexto reutiliza el mismo pipeline de recuento y compara tu prompt con el presupuesto efectivo (ventana − reserva output). Ideal antes de un agente multi-turno o un pegado RAG grande.
Ensamblas system prompt + 20 chunks vectoriales + pregunta de usuario para GPT-4o.
Contar el contexto completo
Pega el conjunto (o el array messages) en el contador. Anota input tokens en el modelo objetivo y comprueba el badge Exact vs Estimate.
Probar el margen contextual
Abre la calculadora de ventana de contexto con el mismo texto. Si el estado es Near limit o Won't fit, reduce los chunks o pasa a un modelo con ventana más grande.
Proyectar el coste mensual
En la calculadora de precios, introduce input tokens, estima output tokens (p. ej. 500), activa caching si el system prompt es estable y multiplica por las llamadas/día previstas.
Conclusión
Contar los tokens antes de la llamada API evita sorpresas de truncado y de factura. Usa el contador LLM para un recuento honesto (Exact OpenAI, Estimate en el resto), la calculadora de ventana de contexto para validar el margen RAG o multi-turno, y después la calculadora de precios para proyectar el coste USD — todo en el navegador, sin enviar tu prompt a los proveedores.
Artículos relacionados

YAML roto, `on` o `jobs` ausentes, steps vacíos: valida la estructura de tus workflows antes del push — y deja actionlint para la CI.

Errores de sintaxis SDL, review de esquema y formateo antes del merge — complemento al beautify GraphQL existente.

Reduce la factura OpenAI/Anthropic/Gemini: estima input/output, activa batch y caching en tus cálculos — tarifas verificadas, 100 % local.