Un token es la unidad mínima con la que un LLM lee y escribe. No es una palabra ni una letra: es un trozo de texto, normalmente de entre 1 y varios caracteres. El modelo convierte todo tu texto a tokens antes de procesarlo, y produce su respuesta token a token.
Este concepto conecta dos partes de la ruta: es la base de cómo funciona el modelo y también la unidad con la que te cobran (ver Cómo cobran los proveedores).
El proceso se llama tokenización. A grandes rasgos:
casa, the, error.tokenización → token + ización.Regla de bolsillo para estimar (inglés): ~4 caracteres ≈ 1 token, o ~0.75 palabras por token. En español suele salir algo más caro (más tokens por palabra) porque los tokenizadores se entrenaron con más inglés.
Texto: "Programar con IA es práctico."
Tokens: ["Program", "ar", " con", " IA", " es", " práct", "ico", "."]
≈ 8 tokens para 5 palabrasCada interacción tiene dos cifras:
Esta distinción importa porque casi todos los proveedores cobran distinto por cada una (la salida suele ser 3–5× más cara). Lo desarrollamos en la sección de economía.
[!TIP] Si un texto va a repetirse en muchas llamadas (un system prompt largo, un documento de referencia), varios proveedores ofrecen prompt caching: cachean esa parte y te la cobran más barata. Lo veremos en la economía.
Los tokens son la unidad de la ventana de contexto y de cómo cobran los proveedores.