Coste API LLM: batch API, prompt caching y proyección mensual

Coste API LLM: batch API, prompt caching y proyección mensual

Reduce la factura OpenAI/Anthropic/Gemini: estima input/output, activa batch y caching en tus cálculos — tarifas verificadas, 100 % local.

21.08.2026
10 min de lectura
Compartir este artículo:
llm
pricing
batch-api
prompt-caching
openai
ai
Tutorial

Del recuento de tokens a la factura API del mes

Los tokens de entrada y de salida se facturan a tarifas por millón distintas. Contar tokens da un volumen; no dice si el Batch API, el prompt caching o la frecuencia de llamadas dominará la factura. Esta guía empieza donde termina la guía de recuento de tokens: transformar los recuentos en palancas USD. En FastMinify, la calculadora de precios LLM aplica una tabla fechada llm-models.json en el navegador — es un planificador, no una autoridad de facturación. Complétala con el contador de tokens LLM si aún necesitas un recuento Exact o Estimate. El hub de herramientas IA & LLM reúne el resto del cluster.

Separar USD entrada vs salida con (tokens / 1e6) × $/1M
Modelar un Batch API −50 % simplificado sobre el subtotal
Tarificar el tramo de entrada en caché al 10 % de la tarifa input
Proyectar un total a 30 días a partir de las llamadas por día
Ningún prompt se envía a OpenAI, Anthropic o Google

Errores frecuentes: confundir el planificador con la factura

Tomar el −50 % batch por tu rejilla de proveedor

Los descuentos batch varían según el editor, el modelo y las restricciones del job. El toggle de FastMinify es un modelo v1 simplificado para ver la forma del ahorro — no un presupuesto.

A tener en cuentaLee la fecha verificada en la calculadora y confirma la elegibilidad batch y el % en la doc del proveedor antes de briefar a finanzas.

Introducir tokens en caché que nunca has medido

El ahorro de caché solo se aplica al tramo que realmente toca el caché. Si escribes 80 % en caché sobre un prompt de usuario único, el estimado queda bajo y la prod no lo estará.

A tener en cuentaParte de 0 tokens en caché y solo aumenta para un prefijo estable documentado (system, herramientas, contexto fijo).

Leer la línea mensual como una factura

El ×30 supone que cada día se parece a hoy. Descuentos de cuenta, retries en fallo y precios regionales nunca entran en esta fórmula.

A tener en cuentaUsa Por mes (30 días) para ordenar opciones; reconcilia el gasto en el panel del proveedor. La herramienta no coincidirá con la factura al céntimo.

Tarificar los recuentos de tokens incorrectos

Un contador de palabras o el tokenizer de otro modelo distorsiona los USD. Claude y Gemini están en el palier Estimate (±5–15 %) en FastMinify, no cifras oficiales del proveedor.

A tener en cuentaCuenta primero en el modelo objetivo con el contador de tokens LLM y luego transfiere entrada/salida a la calculadora de precios.

Límites honestos y uso de las cifras

Tabla fechada, no una API de precios en directo

Las tarifas viven en un archivo llm-models.json mantenido a mano, revisado al menos una vez al mes. La fecha verificada de la herramienta refleja esa revisión.

Las tarifas de lista cambian sin aviso en los sitios de los proveedores — vuelve a comprobar antes de un gasto grande
Descuentos de cuenta, créditos y precios regionales fuera de alcance
Los litigios se resuelven en el panel del proveedor, no aquí
El $/1M personalizado es el camino de hipótesis si tienes una tarifa de contrato
Solo USD en v1
Lo que la v1 no modela

La calculadora es un planificador indicativo para facturas de tipo chat/completion.

Sin reglas de embeddings, imagen, audio ni tool-call
Sin simulación de TTL de caché, pinning de prefijo ni hit-rate del proveedor
El −50 % batch no es la matriz batch publicada de cada editor
Recuentos Estimate: ±5–15 % — no presupuestes al último dólar solo con Estimate
Los tokens de salida siguen siendo manuales — el campo de pegado no adivina las completions
Privacidad

Todos los cálculos y la derivación opcional de tokens corren en el navegador. FastMinify no llama a APIs de tarifas de proveedores ni sube los prompts.

Adecuado para prompts propietarios y specs internas
Sin cuenta requerida para estimar
Tope 512 KiB — recorta los exports muy grandes
Instrumenta los usage tokens del proveedor en producción como fuente de verdad
Flujo del hub: contador de tokens → calculadora de precios → calculadora de ventana de contexto si el prompt también corre riesgo de desbordamiento

Cuatro palancas USD: entrada, salida, batch y caché

Entrada vs salida: dos contadores, dos tarifas

Los proveedores publican un $ / 1M de tokens de entrada y un $ / 1M de tokens de salida. FastMinify calcula en local (tokens / 1 000 000) × $/1M para el modelo elegido. Las completions suelen ser varias veces más caras por token que los prompts — una pregunta corta con una respuesta larga puede costar más que un pegado RAG grande seguido de un párrafo. Los tokens de salida no se derivan automáticamente en v1: introdúcelos desde los logs o según lo que esperas del modelo.

Subtotal = entrada fresca + entrada en caché + salida; el descuento Batch −50 % se aplica a ese subtotal
Pega un prompt para derivar los tokens de entrada con el mismo countTokensAsync que el contador
Badge Exact (codificaciones OpenAI) vs Estimate (±5–15 %) para Claude y Gemini
Usa los campos numéricos si ya tienes el uso del lado del proveedor
512 KiB UTF-8 máx. por pegado en las herramientas IA de FastMinify
Batch API: un −50 % plano, modelo v1

Los endpoints batch intercambian latencia por una tarifa más baja. El toggle Batch API de la calculadora aplica un descuento plano del 50 % sobre el subtotal (USD entrada + salida antes del descuento). Es un modelo v1 simplificado — no un scrape en directo de las rejillas batch de OpenAI, Anthropic o Google, ni de las ventanas de elegibilidad. Comprueba la tarifa real y si tu carga es elegible antes de congelar un presupuesto.

batch activado → Total por llamada = 50 % del total sin batch
El descuento se aplica después del cálculo entrada/salida (y caché), sobre el subtotal
Jobs de noche / offline: candidatos batch típicos; un chat en tiempo real, rara vez
La elegibilidad y el % real están en el sitio del proveedor — no en esta herramienta
Desactiva el toggle para comparar interactivo vs batch a recuentos iguales
Prompt caching: 10 % de la tarifa de entrada sobre el tramo en caché

Las llamadas repetidas que comparten un prefijo estable (system prompt, definiciones de herramientas, corpus RAG fijo) pueden tocar un caché de prompt. FastMinify tarifica el tramo de entrada en caché al 10 % de la tarifa de entrada del modelo (90 % de ahorro solo sobre esa porción). Indicas cuántos tokens de entrada esperas desde el caché — la herramienta no simula la lógica de hit, los TTL ni las longitudes mínimas de prefijo del proveedor.

El coste «Tokens entrada en caché» usa el 10 % del $/1M de entrada; el campo está topeado para no superar el total de entrada
El resto de entrada «fresh» paga la tarifa completa
Los tokens de salida nunca se cachean en este modelo v1
Un system prompt estable cachea mejor que un turno de usuario único
El campo es una hipótesis — no una tasa de hit garantizada
Proyección mensual: llamadas por día × 30

Cuando llamadas por día es mayor que cero, la calculadora pone el USD diario = Total por llamada × llamadas/día, y luego Por mes (30 días) = diario × 30. Es una extrapolación lineal a 30 días: sin fines de semana, sin estacionalidad, sin días pico. Úsala para comparar modelos o palancas, y después reconcilia con el panel del proveedor.

Ejemplo: 10 llamadas/día → Por mes (30 días) = Total por llamada × 300
Cero llamadas/día → no hay línea mensual (el total por llamada sigue visible)
Comparar todos los modelos reutiliza los mismos recuentos y opciones sobre el registro
Las tarifas $/1M personalizadas cubren un contrato o una hipótesis
Solo USD en v1 — sin IVA, compromiso ni divisa regional

Flujo: contador de tokens → calculadora de precios → línea mensual

Paso 1 — Obtener tokens de entrada honestos

Abre el contador de tokens LLM. Pega el prompt o el JSON messages que vas a enviar. Elige el mismo modelo que la llamada API. Copia el total de entrada (badge Exact o Estimate).

El mismo pipeline countTokensAsync que el campo de pegado de la calculadora de precios
Exact (OpenAI) vs Estimate (Claude, Gemini) — no trates Estimate como palabra de evangelio
El modo messages API añade un overhead ChatML vs texto bruto
512 KiB máx. — recorta los dumps RAG demasiado grandes
El detalle del tokenizer está en la guía de recuento enlazada más arriba
Paso 2 — Aplicar las palancas USD en la calculadora

Abre la calculadora de precios LLM. Introduce los recuentos entrada/salida (o pega para derivar la entrada). Indica los tokens de salida a mano. Activa Batch API, tokens de entrada en caché y llamadas por día. La fecha verificada de la página es la última revisión de tabla — no la fecha de tu factura.

Detalle de costes: Tokens entrada frescos, Tokens entrada en caché, Tokens salida, Descuento Batch API, Total por llamada
Batch API −50 % sobre el subtotal (v1 simplificado)
Tramo en caché al 10 % de la tarifa de entrada
$/1M personalizado si tu contrato difiere de las tarifas de lista
Comparar todos los modelos — mismos recuentos, cada línea del registro
Escenario — batch RAG de noche vs chat interactivo

Lanzas una síntesis 200k entrada / 2k salida 50 veces al día. La mitad de la entrada es un prefijo system + corpus que esperas cachear. El chat interactivo no puede esperar una ventana batch.

1

Baseline de la llamada interactiva

Introduce 200k entrada, 2k salida, 0 en caché, batch off, 50 llamadas/día. Lee Total por llamada y Por mes (30 días).

2

Añadir el caché sobre el prefijo estable

Ajusta la entrada en caché al tamaño de prefijo realmente reutilizado (no el 100 % del pegado). Observa Tokens entrada en caché en el detalle — más barato que Tokens entrada frescos; la salida no cambia. El descuento Batch −50 % se aplica después a todo el subtotal, incluido ese tramo ya reducido.

3

Pasar el job de noche a batch

Para el run no interactivo, activa Batch API y compara Por mes (30 días). Mantén batch off en el chat sensible a la latencia — el −50 % es un planificador, no una garantía de plazo.

Conclusión

Una estimación útil separa entrada y salida, y después prueba las palancas Batch API y prompt cache sobre recuentos tomados en el modelo objetivo. La calculadora FastMinify lo hace en local con una tabla fechada, un −50 % batch v1, la entrada en caché al 10 % de la tarifa input y una línea mensual ×30. No coincidirá con la factura al céntimo — y es a propósito: planifica aquí, reconcilia en el panel del proveedor. Cuenta primero los tokens si aún necesitas el volumen; después, tarifica las palancas.

Estimar el USD por llamada y mensual a partir de tus recuentos de tokens

Cuenta en el modelo objetivo antes de tarificar
Trata el −50 % batch como una forma v1, no un presupuesto
Solo aumenta los tokens en caché para un prefijo estable medido
Lee Por mes (30 días) como una recta de 30 días, no estacionalidad
Comprueba la fecha verificada y después la doc del proveedor antes de un gasto grande
Compartir este artículo
Compartir este artículo: