2/6Qué es un LLM, qué son los tokens y qué es la ventana de contexto: cuánto cabe de verdad en un chat›
- 01Qué es la inteligencia artificial y qué es la IA generativa: la definición legal y cómo predice›
- 02Qué es un LLM, qué son los tokens y qué es la ventana de contexto: cuánto cabe de verdad en un chat›
- 03Qué es un prompt y cómo se escribe uno bueno: contexto, tarea, formato y ejemplo, con constructor para copiar›
- 04Qué es ChatGPT, Gemini, Copilot y Claude: qué cubre cada asistente de IA y cuál te conviene›
- 05Qué es un agente de IA y en qué se diferencia de un asistente: las cuatro piezas y cuándo pide permiso›
- 06Qué son las alucinaciones de la IA y qué no contarle a un asistente: por qué inventa y qué guarda cada uno›
Aprende › La inteligencia artificial que usas, explicada
Qué es un LLM, qué son los tokens y qué es la ventana de contexto: cuánto cabe de verdad en un chat
Lo que te llevas
- Saber qué es un token y calcular cuántos ocupa un texto en español con el Contador de tokens de m8d.io.
- Leer la ventana de contexto de un plan y saber si tu contrato, tu informe o tu novela caben de una vez o hay que trocearlos.
- Entender por qué un chat largo «olvida» el principio y qué hacer para que no pase.
El concepto
Qué es un LLM y qué quiere decir «de gran tamaño»
LLM son las siglas inglesas de large language model, modelo de lenguaje de gran tamaño. Es el motor que hay detrás de cada asistente: ChatGPT es la aplicación y GPT-5.6 Luna o GPT-6 Astra son los LLM que la mueven (OpenAI, centro de ayuda, 3 de septiembre de 2026); Gemini es la app y Gemini 3.6 Flash o 3.1 Pro son sus modelos; Claude es el asistente y Sonnet, Opus o Fable, sus modelos. La pregunta «¿ChatGPT es un LLM?», que Google muestra junto a esta lección, se responde así: ChatGPT usa un LLM, y puedes cambiar de LLM dentro de la misma aplicación.
«De gran tamaño» se refiere a dos cosas medibles: el número de parámetros del modelo (los pesos que ajusta el entrenamiento, del orden de miles de millones) y la cantidad de texto con la que se entrenó. Lo que hace el modelo con todo eso es una sola operación, repetida: dado un texto, calcular la probabilidad de cada token posible como continuación y elegir uno. La lección anterior lo enseña con un simulador; esta explica las dos unidades que gobiernan el uso real, el token y la ventana de contexto, porque son las que aparecen en la letra pequeña de cada plan y las que deciden si tu documento cabe.
La unidad
Qué son los tokens y por qué el español gasta un 30 % más que el inglés
Un token no es una palabra. Es la pieza en que el modelo trocea el texto antes de leerlo, y el troceado lo decide una tabla fija que cada fabricante publica o describe: OpenAI, en su artículo sobre tokens actualizado en agosto de 2026, dice que en inglés «1 token equivale a unos 4 caracteres» y «a unas tres cuartas partes de una palabra», que «100 tokens son unas 75 palabras», y avisa de que «otros idiomas pueden tener relaciones distintas entre caracteres, palabras y tokens». En español la relación se invierte: las palabras llevan tildes, eñes y terminaciones largas que la tabla, construida sobre todo con inglés, parte en más trozos.
El dato de esta lección no sale de una estimación sino de una medición con la tabla real: el tokenizador o200k_base que OpenAI publica en abierto, aplicado el 5 de septiembre de 2026 a un texto en español de 2.300 palabras, produjo 3.004 tokens, es decir, 1,31 tokens por palabra y 5,0 caracteres por token; la prosa de esta misma lección (1.096 palabras) dio 1.495 tokens, 1,36 por palabra. Con la misma tabla, una muestra en inglés dio 1,14 tokens por palabra. Traducido a lo que te importa: un documento de 10.000 palabras en español son unos 13.000 tokens, no 7.500 como sugiere la regla inglesa, y ese 30 % de diferencia es el que hace que un archivo «quepa» en un plan y no en otro. El Contador de tokens de un texto y de lo que cabe en la ventana de contexto, de m8d.io, aplica la cifra medida a lo que pegues.
Herramienta de m8d.io, gratis y sin cuenta
Contador de tokens de un texto y de lo que cabe en cada ventana de contexto
Pega un texto o elige un tamaño de ejemplo y sale cuántos tokens ocupa en español (1,31 por palabra, medido con el tokenizador de OpenAI el 5 de septiembre de 2026) y qué parte de la ventana de cada plan llena, con la cifra que declara cada fabricante. Gratis, sin cuenta y sin anuncios.
Ejemplo: un contrato de 20 páginas (unas 8.000 palabras) son unos 10.500 tokens: ocupa el 39 % de la ventana de 27.000 tokens del plan gratis de ChatGPT, el 5 % de los 200.000 del plan gratis de Claude y cabe 95 veces en el millón de Gemini 3.1 Pro.
El límite
Qué es la ventana de contexto: la memoria de trabajo del chat y lo que se cae por el borde
Anthropic la define en su documentación técnica como «todo el texto al que un modelo de lenguaje puede referirse al generar una respuesta, incluida la propia respuesta», y la compara con una «memoria de trabajo» distinta del corpus con el que se entrenó. Dentro de esa ventana cuenta todo: tus mensajes, las respuestas anteriores, los archivos que subes, las instrucciones ocultas del sistema y, en los modelos de razonamiento, los tokens que gastan pensando. Cuando la conversación la llena, las aplicaciones de chat descartan lo más antiguo «por orden de llegada», según la misma documentación: el modelo no se queja, simplemente deja de ver el principio.
El tamaño depende del plan, no del anuncio del modelo. La tabla de planes de ChatGPT del 5 de septiembre de 2026 da, para el modelo rápido, 27.000 tokens en el plan gratis (unas 12 páginas de entrada, dice la propia tabla), 54.000 en Go y Plus y 128.000 en Pro; para el modelo de razonamiento, «varía» en el gratis, 256.000 en Go y Plus y 400.000 en Pro; y su nota al pie avisa de que «la parte disponible para la entrada del usuario es menor que la ventana total» porque el sistema, la memoria y el razonamiento ocupan espacio. Claude da 200.000 tokens en sus planes gratis y Pro y 1.000.000 en sus modelos grandes por API; Gemini 3.1 Pro declara 1.000.000 de entrada y 64.000 de salida. Con la cifra medida arriba, 27.000 tokens son unas 20.600 palabras en español; 1.000.000, unas 760.000.
Más ventana no siempre es mejor, y lo dice quien la vende: la documentación de Anthropic avisa de que «a medida que crece el número de tokens, la precisión y la memoria se degradan, un fenómeno conocido como context rot», y recomienda cuidar qué entra en la ventana tanto como cuánto espacio queda. La regla práctica sale sola: un documento importante se pega al principio de un chat nuevo, no al final de uno largo, y si el plan es gratis se trocea por debajo de las diez páginas. Para el caso concreto de Claude Code, la Academy tiene una lección sobre la gestión del contexto en Claude Code.
Lo que se pregunta
Cómo se hace un LLM: preentrenamiento, ajuste y los tokens de razonamiento
«¿Cómo se hace un LLM?» es otra de las preguntas que Google muestra junto a esta lección. Son tres fases y las tres explican un comportamiento que verás en el chat. En el preentrenamiento el modelo lee texto y aprende a predecir el siguiente token; de ahí sale su fecha de corte, el último momento del que sabe algo, y de ahí que te dé con seguridad una cifra vieja si no busca en la web. En el ajuste por instrucciones aprende a responder en formato pregunta-respuesta y a seguir órdenes, con ejemplos escritos y valorados por personas; de ahí sale su tono de asistente. En la fase de preferencias humanas se premian las respuestas que la gente prefiere; OpenAI explica el 5 de septiembre de 2025 que, como las pruebas de la industria puntúan solo el acierto, esa fase enseña al modelo a «adivinar en vez de reconocer la incertidumbre», que es la raíz de las alucinaciones que trata la última lección.
Desde 2025 hay una cuarta pieza, los modelos de razonamiento: antes de responder generan tokens de pensamiento que no ves. Cuentan y se cobran: OpenAI los describe como tokens de salida que «no son visibles como texto de respuesta pero cuentan para el uso», y Anthropic dice que «todos los tokens de entrada y salida, incluidos los de pensamiento, cuentan para el límite de la ventana de contexto». Una respuesta corta puede haber costado diez veces su longitud, y un plan con «mensajes de razonamiento limitados» se agota antes de lo que parece.
| Categoría | Productos |
|---|---|
| ChatGPT gratis, modelo rápido | 27000 |
| Claude gratis y Pro | 200000 |
| ChatGPT Plus, modelo de razonamiento | 256000 |
| ChatGPT Pro, modelo de razonamiento | 400000 |
| Gemini 3.1 Pro y Claude Fable 5.1 | 1000000 |
5 productos contados. Es un censo de cifras declaradas, en tokens, no de productos: cada fila es la ventana que publica el fabricante para ese plan o modelo. Microsoft no publica la ventana de Copilot para particulares (página de diferencias entre Copilot gratis y Microsoft 365, 5-sep-2026).
«Ventana de contexto de 1 millón de tokens» (Google DeepMind para Gemini 3.1 Pro y Anthropic para Claude Fable 5.1, páginas de modelos leídas el 5 de septiembre de 2026).
La ventana que tienes es la de tu plan, no la del modelo: ChatGPT gratis declara 27.000 tokens y «unas 12 páginas» de entrada; Claude gratis, 200.000. Y la documentación de Anthropic avisa de que «más contexto no es automáticamente mejor»: la precisión y la memoria «se degradan» al crecer el número de tokens. OpenAI añade que la parte disponible para tu texto «es menor que la ventana total».
La ventana útil es la de tu plan y la mitad la gasta el sistema: un documento importante se pega al principio de un chat nuevo, y en un plan gratis se trocea por debajo de diez páginas.
Comprueba lo que has aprendido
Dónde se aplica lo que acabas de aprender
Con los tokens y la ventana entendidos, la decisión es qué asistente de IA te conviene según lo que tienes que meterle: documentos largos, archivos o solo preguntas. La siguiente lección dice qué cubre cada uno con el dato de su fabricante.
Las 8 fuentes de esta lección, con su fecha
- OpenAI: Understanding and counting tokens (centro de ayuda) · actualizado en agosto de 2026, leído el 5-sep-2026
- OpenAI: tabla de planes de ChatGPT (ventana de contexto por plan) · leído el 5-sep-2026
- OpenAI: tabla del tokenizador o200k_base (tiktoken), con la que se midió la cifra de esta lección · descargada el 5-sep-2026
- Anthropic: Context windows (documentación técnica de Claude) · leído el 5-sep-2026
- Anthropic: planes de Claude · leído el 5-sep-2026
- Google DeepMind: Gemini 3.1 Pro (ventana de 1M de entrada y 64k de salida) · leído el 5-sep-2026
- OpenAI: ChatGPT Work and Codex (centro de ayuda; nombres de los modelos en uso) · actualizado el 3-sep-2026, leído el 5-sep-2026
- OpenAI: Why language models hallucinate · 5-sep-2025, leído el 5-sep-2026
Cómo citar esta lección
m8d.io (2026). «Qué es un LLM, qué son los tokens y qué es la ventana de contexto: cuánto cabe de verdad en un chat». Aprende, m8d.io. https://m8d.io/aprende/inteligencia-artificial/que-es-un-llm-y-los-tokens/<a href="https://m8d.io/aprende/inteligencia-artificial/que-es-un-llm-y-los-tokens/">Qué es un LLM, qué son los tokens y qué es la ventana de contexto: cuánto cabe de verdad en un chat</a>, m8d.io (2026).m8d.io. (2026). Qué es un LLM, qué son los tokens y qué es la ventana de contexto: cuánto cabe de verdad en un chat. Aprende. Recuperado el 5 de septiembre de 2026 de https://m8d.io/aprende/inteligencia-artificial/que-es-un-llm-y-los-tokens/Licencia CC BY 4.0: se puede reutilizar, también con fines comerciales, citando m8d.io con enlace.
Lo que se pregunta sobre esto
¿Qué es LLM en ChatGPT?›
El modelo que mueve la aplicación. ChatGPT es la app; el LLM es GPT-5.6 Luna en el plan gratis o GPT-6 Astra en los de pago, según el centro de ayuda de OpenAI del 3 de septiembre de 2026. Puedes cambiar de modelo dentro del mismo chat.
¿Cuál es la diferencia entre LLM y IA?›
La IA es la categoría (cualquier sistema que infiere de datos cómo dar un resultado); un LLM es un tipo concreto de IA: un modelo entrenado con texto para predecir el siguiente token. Todo LLM es IA; el filtro de correo no deseado es IA y no es un LLM.
¿Cómo se hace un LLM?›
En tres fases: preentrenamiento (aprende a predecir el siguiente token leyendo texto), ajuste por instrucciones (aprende a responder y obedecer con ejemplos humanos) y preferencias humanas (se premian las respuestas que la gente prefiere). Los modelos de razonamiento añaden tokens de pensamiento que cuentan y se cobran.
¿Qué es un LLM en inglés?›
Large language model: modelo de lenguaje de gran tamaño. «Large» se refiere al número de parámetros y a la cantidad de texto de entrenamiento.
Comentarios
Sé el primeroSin registro: solo un nombre. Todos los comentarios se revisan antes de publicarse.