
Ventana de contexto LLM: dimensionar prompts para GPT, Claude y Gemini
RAG, agentes multi-turno, system prompts: calcula el % de ventana usada y el margen restante antes de enviar a la API.
¿Por qué dimensionar tus prompts antes de la llamada API?
La ventana de contexto de un modelo LLM limita la suma de tokens que puedes enviar y recibir en una petición. Un system prompt largo, veinte chunks RAG, un historial multi-turno y la respuesta esperada comparten el mismo presupuesto — no cuotas separadas. Rebasa el límite y obtienes un error 400; roza el techo y el modelo puede truncar el inicio o el final del contexto sin un mensaje explícito. En FastMinify, la calculadora de ventana de contexto mide tu prompt contra el registro de modelos GPT, Claude y Gemini — 100 % en el navegador. Complétala con el contador de tokens LLM y el formateador JSON para los payloads messages API. Ver también la guía contar tokens y estimar el coste API y el hub de herramientas IA & LLM.
Errores frecuentes: desbordamiento, truncado y mala lectura
Un modelo «128k» no ofrece 128k tokens de input si esperas 8k tokens de respuesta. Sin reserva output, crees caber en la ventana mientras la generación se cortará.
A tener en cuenta — Activa un 15–20 % de reserva output en la calculadora de ventana de contexto antes de validar un RAG grande.
Algunos pipelines truncan el inicio (system prompt) o el final (chunks recientes) cuando el contexto rebasa el límite — sin error HTTP. El modelo responde igual, pero sobre un contexto incompleto.
A tener en cuenta — Apunta al estado Safe (< 80 % del presupuesto efectivo) en los flujos críticos; Near limit exige un margen de reducción.
Un contador de palabras o de caracteres no refleja la facturación ni la ventana. El código, el JSON y las lenguas no latinas divergen mucho del ratio palabras/tokens.
A tener en cuenta — Pasa por el contador de tokens LLM en el modelo objetivo — badge Exact para OpenAI, Estimate para Claude/Gemini.
Diez mensajes cortos + tool definitions pueden costar cientos de tokens más que un pegado de texto bruto equivalente. Un error de parse JSON también enmascara claves faltantes.
A tener en cuenta — Formatea el payload messages con json-formatter y luego cambia a modo API messages en la calculadora.
Límites honestos y buenas prácticas
FastMinify ayuda a planificar el presupuesto contextual en el navegador — no a simular el comportamiento runtime exacto del provider.
Contar suele revelar grasa evitable en system prompts y contexto duplicado.
El recuento es 100 % client-side — adecuado para prompts con código propietario, PII o specs internas.
Ventana de contexto vs tokens: lo que realmente cuenta
Los proveedores anuncian un límite en tokens (p. ej. 128k, 200k, 1M) — no en palabras ni en caracteres. Un token puede ser una palabra, un fragmento o puntuación. El contador de tokens LLM aplica js-tiktoken (badge Exact) para OpenAI y una heurística caracteres/token (badge Estimate, ±5–15 %) para Claude y Gemini.
La calculadora de ventana de contexto resta una reserva output configurable (10 %, 15 % o 20 % — por defecto 15 %) antes de calcular el presupuesto input efectivo. Si tu prompt ocupa el 85 % de ese presupuesto, estás en estado Near limit aunque la ventana bruta aún muestre margen.
En modo API messages, un array [{"role","content"}] añade un overhead ChatML (+3 tokens por mensaje, +1 por name, +3 priming de respuesta). Formatea y valida la estructura con el formateador JSON antes de pegar en la calculadora. Para RAG, cuenta el contexto inyectado además del mensaje de usuario — no solo la pregunta final.
Flujo: calculadora de ventana, contador de tokens y JSON messages
Abre la calculadora de ventana de contexto. Pega tu prompt bruto o tu array messages JSON. Elige el modelo, la reserva output (10 / 15 / 20 %) y el modo de codificación (Auto o override o200k_base / cl100k_base). La tabla Compare all models lista usage %, tokens restantes y veredicto por modelo.
Para inspeccionar el detalle BPE (OpenAI Exact) o comparar input tokens antes del pricing, abre el contador de tokens LLM con el mismo texto. Ambas herramientas comparten el pipeline countTokensAsync — los totales deben coincidir para un mismo modelo y formato.
Las integraciones Chat Completions suelen enviar un JSON messages. Pégalo en el formateador JSON para detectar comas finales, comillas inválidas o una estructura incorrecta — y recarga el JSON formateado en modo API messages en la calculadora de ventana.
Inyectas 40 chunks vectoriales + system prompt + 6 turnos de historial para Claude Sonnet.
Ensamblar el contexto completo
Pega system + chunks + historial + pregunta en la calculadora (o el array messages equivalente). Selecciona el modelo Anthropic objetivo y reserva 20 % si las respuestas superan 4k tokens.
Leer el veredicto y el margen
Si Won't fit: reduce los chunks (top-k más bajo), resume el historial o pasa a un modelo con ventana más grande vía Compare all models. Si Near limit: prevé un truncado o un split de petición.
Validar el JSON messages
Formatea el payload final en json-formatter, vuelve a contar en modo API messages y cruza con la guía tokens y coste API para la proyección USD.
Conclusión
Dimensionar un prompt es restar una reserva output, contar los tokens en el modelo correcto y leer el veredicto antes de la llamada API. La calculadora de ventana de contexto FastMinify combina registro multi-proveedor, reserva configurable y estados Safe / Near limit / Won't fit — todo en local. Complétala con el contador de tokens para el detalle y json-formatter para los payloads messages; la guía tokens & coste y el hub IA cubren el resto del flujo.
Artículos relacionados

YAML roto, `on` o `jobs` ausentes, steps vacíos: valida la estructura de tus workflows antes del push — y deja actionlint para la CI.

Errores de sintaxis SDL, review de esquema y formateo antes del merge — complemento al beautify GraphQL existente.

Reduce la factura OpenAI/Anthropic/Gemini: estima input/output, activa batch y caching en tus cálculos — tarifas verificadas, 100 % local.