Ventana de contexto LLM: dimensionar prompts para GPT, Claude y Gemini

Ventana de contexto LLM: dimensionar prompts para GPT, Claude y Gemini

RAG, agentes multi-turno, system prompts: calcula el % de ventana usada y el margen restante antes de enviar a la API.

19.08.2026
8 min de lectura
Compartir este artículo:
llm
context-window
prompt
rag
agents
ai
Tutorial

¿Por qué dimensionar tus prompts antes de la llamada API?

La ventana de contexto de un modelo LLM limita la suma de tokens que puedes enviar y recibir en una petición. Un system prompt largo, veinte chunks RAG, un historial multi-turno y la respuesta esperada comparten el mismo presupuesto — no cuotas separadas. Rebasa el límite y obtienes un error 400; roza el techo y el modelo puede truncar el inicio o el final del contexto sin un mensaje explícito. En FastMinify, la calculadora de ventana de contexto mide tu prompt contra el registro de modelos GPT, Claude y Gemini — 100 % en el navegador. Complétala con el contador de tokens LLM y el formateador JSON para los payloads messages API. Ver también la guía contar tokens y estimar el coste API y el hub de herramientas IA & LLM.

Visualizar el % de presupuesto efectivo consumido antes de la llamada
Reservar un margen output (10–20 %) para evitar cortes al final de la generación
Comparar todos los modelos del registro FastMinify sobre el mismo pegado
Estados Safe, Near limit y Won't fit alineados con un umbral al 80 %
Ningún envío de prompt a los proveedores — recuento local únicamente

Errores frecuentes: desbordamiento, truncado y mala lectura

Confundir ventana bruta y presupuesto usable

Un modelo «128k» no ofrece 128k tokens de input si esperas 8k tokens de respuesta. Sin reserva output, crees caber en la ventana mientras la generación se cortará.

A tener en cuentaActiva un 15–20 % de reserva output en la calculadora de ventana de contexto antes de validar un RAG grande.

Ignorar el truncado silencioso

Algunos pipelines truncan el inicio (system prompt) o el final (chunks recientes) cuando el contexto rebasa el límite — sin error HTTP. El modelo responde igual, pero sobre un contexto incompleto.

A tener en cuentaApunta al estado Safe (< 80 % del presupuesto efectivo) en los flujos críticos; Near limit exige un margen de reducción.

Contar palabras en lugar de tokens

Un contador de palabras o de caracteres no refleja la facturación ni la ventana. El código, el JSON y las lenguas no latinas divergen mucho del ratio palabras/tokens.

A tener en cuentaPasa por el contador de tokens LLM en el modelo objetivo — badge Exact para OpenAI, Estimate para Claude/Gemini.

Olvidar el overhead de messages y las tools

Diez mensajes cortos + tool definitions pueden costar cientos de tokens más que un pegado de texto bruto equivalente. Un error de parse JSON también enmascara claves faltantes.

A tener en cuentaFormatea el payload messages con json-formatter y luego cambia a modo API messages en la calculadora.

Límites honestos y buenas prácticas

Lo que la calculadora no predice

FastMinify ayuda a planificar el presupuesto contextual en el navegador — no a simular el comportamiento runtime exacto del provider.

Registro de modelos mantenido a mano — comprueba la doc oficial antes de prod crítica
Estimate tier (Claude, Gemini): ±5–15 % — no bordee el techo solo con Estimate
Sin reglas de tokens de imagen, audio o tool-call específicas en v1
El truncado real depende del SDK y del modelo — el veredicto Won't fit señala un riesgo, no una garantía de error HTTP
Sin llamada API — no se consultan cuotas de billing ni límites de cuenta
Reducir la presión sobre la ventana

Contar suele revelar grasa evitable en system prompts y contexto duplicado.

Acortar las instrucciones system — cada token se repite en cada petición
Deduplicar los chunks RAG — evita pasajes casi idénticos
Resumir el historial multi-turno en lugar de reenviar la transcripción bruta
Modelo con ventana más grande para la ingesta, más pequeño para la síntesis si el pipeline lo permite
TOON para tablas uniformes — ver cuándo TOON supera a JSON (medir, no asumir)
Privacidad y datos sensibles

El recuento es 100 % client-side — adecuado para prompts con código propietario, PII o specs internas.

Ningún upload del contenido pegado hacia OpenAI, Anthropic o Google
Sin cuenta requerida — sin correlación identidad ↔ prompt
512 KiB máx. por pegado — divide los exports muy grandes
Instrumentar los logs API (usage tokens que devuelve el provider) como complemento en producción
Hub IA: encadenar context calculator → token counter → pricing calculator según la necesidad

Ventana de contexto vs tokens: lo que realmente cuenta

Tokens medidos, ventana publicada por modelo

Los proveedores anuncian un límite en tokens (p. ej. 128k, 200k, 1M) — no en palabras ni en caracteres. Un token puede ser una palabra, un fragmento o puntuación. El contador de tokens LLM aplica js-tiktoken (badge Exact) para OpenAI y una heurística caracteres/token (badge Estimate, ±5–15 %) para Claude y Gemini.

La ventana de contexto = techo input + output en una petición (según el modelo)
System prompt, RAG, historial y pregunta de usuario se suman en input tokens
Las tool definitions y el JSON estructurado cuentan como texto tokenizado
Compara siempre en el modelo objetivo — los recuentos varían entre familias
512 KiB UTF-8 máx. por pegado en las herramientas IA de FastMinify
Presupuesto efectivo: reservar sitio para la salida

La calculadora de ventana de contexto resta una reserva output configurable (10 %, 15 % o 20 % — por defecto 15 %) antes de calcular el presupuesto input efectivo. Si tu prompt ocupa el 85 % de ese presupuesto, estás en estado Near limit aunque la ventana bruta aún muestre margen.

effectiveLimit = contextWindow − reserveTokens
remainingTokens = effectiveLimit − promptTokens (suelo en 0)
usagePercent = promptTokens / effectiveLimit × 100
Veredicto Safe si usage < 80 %, Near limit si ≥ 80 %, Won't fit si hay desbordamiento
Agentes multi-turno: aumenta la reserva si las completions superan a menudo 2–4k tokens
RAG, agentes y prompts messages API

En modo API messages, un array [{"role","content"}] añade un overhead ChatML (+3 tokens por mensaje, +1 por name, +3 priming de respuesta). Formatea y valida la estructura con el formateador JSON antes de pegar en la calculadora. Para RAG, cuenta el contexto inyectado además del mensaje de usuario — no solo la pregunta final.

RAG voluminoso: el principal consumidor suelen ser los chunks, no la pregunta
Agentes multi-turno: el historial crece en cada turno — vuelve a contar antes de cada llamada
System prompts estables: buen candidato para prompt caching (ver guía de precios)
El modo Auto detecta texto bruto vs array messages JSON
Compare all models: vista tabla sobre todo el registro FastMinify

Flujo: calculadora de ventana, contador de tokens y JSON messages

Paso 1 — Pegar y contar en la calculadora de ventana

Abre la calculadora de ventana de contexto. Pega tu prompt bruto o tu array messages JSON. Elige el modelo, la reserva output (10 / 15 / 20 %) y el modo de codificación (Auto o override o200k_base / cl100k_base). La tabla Compare all models lista usage %, tokens restantes y veredicto por modelo.

Veredictos Safe, Near limit (≥ 80 %), Won't fit (desbordamiento del presupuesto efectivo)
Reserva output 10 %, 15 % o 20 % — por defecto 15 %
Modo texto bruto o API messages JSON con detección Auto
Badge Exact (OpenAI) o Estimate (Claude, Gemini) por línea
512 KiB máx. — divide los payloads muy grandes antes de pegar
Paso 2 — Afina el recuento con el token counter

Para inspeccionar el detalle BPE (OpenAI Exact) o comparar input tokens antes del pricing, abre el contador de tokens LLM con el mismo texto. Ambas herramientas comparten el pipeline countTokensAsync — los totales deben coincidir para un mismo modelo y formato.

Visualización token pills solo para los modelos Exact
Compare all models — tabla de recuento sobre el registro
Copiar el total para alimentar la calculadora de precios si hace falta
El mismo límite 512 KiB y los mismos tiers Exact/Estimate
Complemento del context calculator — no un duplicado funcional
Paso 3 — Preparar los payloads messages API

Las integraciones Chat Completions suelen enviar un JSON messages. Pégalo en el formateador JSON para detectar comas finales, comillas inválidas o una estructura incorrecta — y recarga el JSON formateado en modo API messages en la calculadora de ventana.

Validación de sintaxis antes del recuento — evita sorpresas de parse
Árbol legible para localizar mensajes redundantes
100 % local — práctico para specs internas o código propietario
Encadenar con context-window-calculator en modo messages
Ver la guía <a href="/es/blog/json-formatter-diff-arbol-guia" class="text-primary hover:underline">JSON Formatter, Diff y Tree Viewer</a> para payloads profundos
Escenario — agente RAG multi-turno sobre Claude

Inyectas 40 chunks vectoriales + system prompt + 6 turnos de historial para Claude Sonnet.

1

Ensamblar el contexto completo

Pega system + chunks + historial + pregunta en la calculadora (o el array messages equivalente). Selecciona el modelo Anthropic objetivo y reserva 20 % si las respuestas superan 4k tokens.

2

Leer el veredicto y el margen

Si Won't fit: reduce los chunks (top-k más bajo), resume el historial o pasa a un modelo con ventana más grande vía Compare all models. Si Near limit: prevé un truncado o un split de petición.

3

Validar el JSON messages

Formatea el payload final en json-formatter, vuelve a contar en modo API messages y cruza con la guía tokens y coste API para la proyección USD.

Conclusión

Dimensionar un prompt es restar una reserva output, contar los tokens en el modelo correcto y leer el veredicto antes de la llamada API. La calculadora de ventana de contexto FastMinify combina registro multi-proveedor, reserva configurable y estados Safe / Near limit / Won't fit — todo en local. Complétala con el contador de tokens para el detalle y json-formatter para los payloads messages; la guía tokens &amp; coste y el hub IA cubren el resto del flujo.

Reservar 15–20 % para el output en agentes y cadenas largas
Apuntar a Safe (&lt; 80 %) en los flujos RAG críticos
Volver a contar después de cada turno de historial multi-turno
Tratar Estimate como planificación, no como límite oficial Anthropic/Google
Cruzar con la guía contar tokens y coste API para la proyección USD
Compartir este artículo
Compartir este artículo: