Cuando hablamos de tokens, hablamos de un concepto básico para entender cómo funcionan los LLMs, ya que es sobre el que se sienta todo el procesamiento de lenguaje natural de las Inteligencias Artificiales.
Grosso modo, si los humanos pensamos en palabras, la IA piensa en tokens.
¿Qué es un token?
Un token es la unidad básica de información que un modelo de IA utiliza para procesar y generar texto. No equivale necesariamente a una palabra completa, sino que es un fragmento de texto en el que se divide una cadena de caracteres. Dependiendo del idioma y de la estructura de la palabra, un token puede ser una palabra completa, un solo carácter, un espacio en blanco o parte de una palabra.
Por ejemplo, la palabra Internet puede ser un único token, mientras que la palabra superestructura puede convertirse en dos tokens: super y estructura. Para que la IA pueda entenderlo, a cada token se asocia un identificativo único para identificar el número de tokens que utiliza, un proceso llamado tokenización.
Cómo se cuentan
De forma aproximada y basándonos en el idioma inglés (el utilizado para su entrenamiento), un token equivale a 0,75 palabras en inglés (100 tokens equivalen a unas 75 palabras en inglés). En español, debido a las conjugaciones, tildes y caracteres especiales como la ñ, una sola palabra a menudo equivale a 2 o más tokens.
| Frase | Idioma | Tokens | Comentario |
|---|---|---|---|
| Buenos días | Español | 4 | La tilde en 'días' incrementa los tokens respecto a 'dias' (3 tokens) |
| Good morning | Inglés | 2 | Dos palabras comunes que el tokenizador captura como unidades únicas |
| ¿Cómo estás? | Español | 6 | Signos de interrogación inicial y final + tilde en 'estás' suman tokens |
| How are you? | Inglés | 3 | El signo '?' se tokeniza por separado |
| La inteligencia artificial generativa está transformando... | Español | 18 | Palabras como 'artificial' o 'transformando' se fraccionan en 2‑3 tokens |
| Generative artificial intelligence is transforming... | Inglés | 10 | Menor fragmentación gracias a palabras más cortas y comunes en el corpus de entrenamiento |
¿Para qué sirven los tokens?
Los modelos de IA no entienden el texto directamente, ya que son motores matemáticos basados en estadísticas y vectores. Los tokens sirven como el puente que se encarga de traducir entre nuestro lenguaje y el suyo.
Al dividir el lenguaje natural en identificativos, los modelos reducen el tamaño del vocabulario que deben memorizar, en lugar de aprender, todas las variantes de una misma palabra, aprenden únicamente la raíz y los sufijos principales. Esto permite estructurar la cantidad de información que el modelo puede retener en una ventana de contexto.
Cuando hacemos una pregunta (input) a una IA, consumimos tokens al igual que cuando recibimos la respuesta (output). El coste de uso es la suma de los tokens enviados y los recibidos. En las API de OpenAI, Google, Anthropic, entre otros, los tokens son la moneda que se utiliza y se cobra por tramos de una determinada cantidad de tokens procesados (input) y generados (output).
Cómo se gastan
Con la llegada de la IA multimodal, Inteligencia Artificial capaz de procesar todo tipo de datos y generar diferentes formatos de respuesta (código, imágenes, PDF, tablas, archivos de audio, vídeos, entre otros) se ha incrementado el uso de los tokens. No es lo mismo pedirle a ChatGPT que te escriba un menú para cada día de la semana que cree una imagen representativa de los menús con su correspondiente imagen.
La evolución a la IA multimodal fue el pensamiento profundo y razonamiento. Estos modelos añadieron un coste extra en el consumo de tokens sin que el usuario se diera cuenta debido a los procesos de análisis, autoevaluación y descarte del contenido que no considera relevante para la investigación.
Actualmente nos encontramos en la época de los agentes autónomos o IA agentiva. Esta funciona de forma autónoma las 24 horas del día para cumplir con la labor que se le ha encomendado. Debido a su funcionamiento desatendido, ha disparado el consumo de tokens y lo que una simple petición que consume 50 tokens puede pasar a decenas de miles debido a las consultas iterativas que realiza para completar su objetivo.
Cada modelo de IA tiene un límite físico: la ventana de contexto. Esto representa la cantidad máxima de tokens que el modelo puede procesar entre el prompt del usuario (input) y su propia respuesta a la vez (output).
Si un modelo tiene una ventana de 128.000 tokens, significa que puedes introducir el equivalente a unas 95.000 palabras de golpe antes de que la IA empiece a «olvidar» el principio de la conversación, es decir, que pierde parte de la ventana de contexto y no tiene en cuenta todo el texto introducido para generar la respuesta.
Resumen rápido
- Un token es un pedazo de palabra, no una palabra entera.
- Los modelos de IA pagan, cobran y recuerdan en tokens, no en bytes ni en caracteres.
- El español consume más tokens por frase que el inglés debido a la estructura del diseño de los tokenizadores actuales.
