
Coste API LLM: batch API, prompt caching y proyección mensual
Reduce la factura OpenAI/Anthropic/Gemini: estima input/output, activa batch y caching en tus cálculos — tarifas verificadas, 100 % local.
Del recuento de tokens a la factura API del mes
Los tokens de entrada y de salida se facturan a tarifas por millón distintas. Contar tokens da un volumen; no dice si el Batch API, el prompt caching o la frecuencia de llamadas dominará la factura. Esta guía empieza donde termina la guía de recuento de tokens: transformar los recuentos en palancas USD. En FastMinify, la calculadora de precios LLM aplica una tabla fechada llm-models.json en el navegador — es un planificador, no una autoridad de facturación. Complétala con el contador de tokens LLM si aún necesitas un recuento Exact o Estimate. El hub de herramientas IA & LLM reúne el resto del cluster.
Errores frecuentes: confundir el planificador con la factura
Los descuentos batch varían según el editor, el modelo y las restricciones del job. El toggle de FastMinify es un modelo v1 simplificado para ver la forma del ahorro — no un presupuesto.
A tener en cuenta — Lee la fecha verificada en la calculadora y confirma la elegibilidad batch y el % en la doc del proveedor antes de briefar a finanzas.
El ahorro de caché solo se aplica al tramo que realmente toca el caché. Si escribes 80 % en caché sobre un prompt de usuario único, el estimado queda bajo y la prod no lo estará.
A tener en cuenta — Parte de 0 tokens en caché y solo aumenta para un prefijo estable documentado (system, herramientas, contexto fijo).
El ×30 supone que cada día se parece a hoy. Descuentos de cuenta, retries en fallo y precios regionales nunca entran en esta fórmula.
A tener en cuenta — Usa Por mes (30 días) para ordenar opciones; reconcilia el gasto en el panel del proveedor. La herramienta no coincidirá con la factura al céntimo.
Un contador de palabras o el tokenizer de otro modelo distorsiona los USD. Claude y Gemini están en el palier Estimate (±5–15 %) en FastMinify, no cifras oficiales del proveedor.
A tener en cuenta — Cuenta primero en el modelo objetivo con el contador de tokens LLM y luego transfiere entrada/salida a la calculadora de precios.
Límites honestos y uso de las cifras
Las tarifas viven en un archivo llm-models.json mantenido a mano, revisado al menos una vez al mes. La fecha verificada de la herramienta refleja esa revisión.
La calculadora es un planificador indicativo para facturas de tipo chat/completion.
Todos los cálculos y la derivación opcional de tokens corren en el navegador. FastMinify no llama a APIs de tarifas de proveedores ni sube los prompts.
Cuatro palancas USD: entrada, salida, batch y caché
Los proveedores publican un $ / 1M de tokens de entrada y un $ / 1M de tokens de salida. FastMinify calcula en local (tokens / 1 000 000) × $/1M para el modelo elegido. Las completions suelen ser varias veces más caras por token que los prompts — una pregunta corta con una respuesta larga puede costar más que un pegado RAG grande seguido de un párrafo. Los tokens de salida no se derivan automáticamente en v1: introdúcelos desde los logs o según lo que esperas del modelo.
Los endpoints batch intercambian latencia por una tarifa más baja. El toggle Batch API de la calculadora aplica un descuento plano del 50 % sobre el subtotal (USD entrada + salida antes del descuento). Es un modelo v1 simplificado — no un scrape en directo de las rejillas batch de OpenAI, Anthropic o Google, ni de las ventanas de elegibilidad. Comprueba la tarifa real y si tu carga es elegible antes de congelar un presupuesto.
Las llamadas repetidas que comparten un prefijo estable (system prompt, definiciones de herramientas, corpus RAG fijo) pueden tocar un caché de prompt. FastMinify tarifica el tramo de entrada en caché al 10 % de la tarifa de entrada del modelo (90 % de ahorro solo sobre esa porción). Indicas cuántos tokens de entrada esperas desde el caché — la herramienta no simula la lógica de hit, los TTL ni las longitudes mínimas de prefijo del proveedor.
Cuando llamadas por día es mayor que cero, la calculadora pone el USD diario = Total por llamada × llamadas/día, y luego Por mes (30 días) = diario × 30. Es una extrapolación lineal a 30 días: sin fines de semana, sin estacionalidad, sin días pico. Úsala para comparar modelos o palancas, y después reconcilia con el panel del proveedor.
Flujo: contador de tokens → calculadora de precios → línea mensual
Abre el contador de tokens LLM. Pega el prompt o el JSON messages que vas a enviar. Elige el mismo modelo que la llamada API. Copia el total de entrada (badge Exact o Estimate).
Abre la calculadora de precios LLM. Introduce los recuentos entrada/salida (o pega para derivar la entrada). Indica los tokens de salida a mano. Activa Batch API, tokens de entrada en caché y llamadas por día. La fecha verificada de la página es la última revisión de tabla — no la fecha de tu factura.
Lanzas una síntesis 200k entrada / 2k salida 50 veces al día. La mitad de la entrada es un prefijo system + corpus que esperas cachear. El chat interactivo no puede esperar una ventana batch.
Baseline de la llamada interactiva
Introduce 200k entrada, 2k salida, 0 en caché, batch off, 50 llamadas/día. Lee Total por llamada y Por mes (30 días).
Añadir el caché sobre el prefijo estable
Ajusta la entrada en caché al tamaño de prefijo realmente reutilizado (no el 100 % del pegado). Observa Tokens entrada en caché en el detalle — más barato que Tokens entrada frescos; la salida no cambia. El descuento Batch −50 % se aplica después a todo el subtotal, incluido ese tramo ya reducido.
Pasar el job de noche a batch
Para el run no interactivo, activa Batch API y compara Por mes (30 días). Mantén batch off en el chat sensible a la latencia — el −50 % es un planificador, no una garantía de plazo.
Conclusión
Una estimación útil separa entrada y salida, y después prueba las palancas Batch API y prompt cache sobre recuentos tomados en el modelo objetivo. La calculadora FastMinify lo hace en local con una tabla fechada, un −50 % batch v1, la entrada en caché al 10 % de la tarifa input y una línea mensual ×30. No coincidirá con la factura al céntimo — y es a propósito: planifica aquí, reconcilia en el panel del proveedor. Cuenta primero los tokens si aún necesitas el volumen; después, tarifica las palancas.
Artículos relacionados

YAML roto, `on` o `jobs` ausentes, steps vacíos: valida la estructura de tus workflows antes del push — y deja actionlint para la CI.

Errores de sintaxis SDL, review de esquema y formateo antes del merge — complemento al beautify GraphQL existente.

RAG, agentes multi-turno, system prompts: calcula el % de ventana usada y el margen restante antes de enviar a la API.