Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Fundamentos
Árbol de habilidades

Tokens

2 min de lecturaActualizado el 9 jul 2026

Un token es la unidad mínima con la que un LLM lee y escribe. No es una palabra ni una letra: es un trozo de texto, normalmente de entre 1 y varios caracteres. El modelo convierte todo tu texto a tokens antes de procesarlo, y produce su respuesta token a token.

Este concepto conecta dos partes de la ruta: es la base de cómo funciona el modelo y también la unidad con la que te cobran (ver Cómo cobran los proveedores).

Cómo se parte el texto

El proceso se llama tokenización. A grandes rasgos:

  • Palabras comunes suelen ser un solo token: casa, the, error.
  • Palabras largas o raras se parten en varios: tokenización → token + ización.
  • Espacios, signos y saltos de línea también cuentan.
  • El código se fragmenta distinto que la prosa; un bloque de JSON gasta más tokens de lo que parece.

Regla de bolsillo para estimar (inglés): ~4 caracteres ≈ 1 token, o ~0.75 palabras por token. En español suele salir algo más caro (más tokens por palabra) porque los tokenizadores se entrenaron con más inglés.

Texto: "Programar con IA es práctico." Tokens: ["Program", "ar", " con", " IA", " es", " práct", "ico", "."] ≈ 8 tokens para 5 palabras

Entrada y salida se cuentan por separado

Cada interacción tiene dos cifras:

  • Tokens de entrada (input): todo lo que entra al modelo. Incluye tu mensaje, las instrucciones del sistema, y —clave— todo el historial de la conversación que se reenvía en cada turno.
  • Tokens de salida (output): lo que el modelo genera.

Esta distinción importa porque casi todos los proveedores cobran distinto por cada una (la salida suele ser 3–5× más cara). Lo desarrollamos en la sección de economía.

Por qué te conviene pensar en tokens

  • Coste: una conversación larga reenvía todo su historial como input en cada turno. El costo crece con la longitud acumulada, no solo con tu último mensaje.
  • Límite: el modelo solo puede considerar un número máximo de tokens a la vez, su ventana de contexto. Todo se mide en tokens.
  • Velocidad: más tokens de salida = más lento, porque los genera de uno en uno.

[!TIP] Si un texto va a repetirse en muchas llamadas (un system prompt largo, un documento de referencia), varios proveedores ofrecen prompt caching: cachean esa parte y te la cobran más barata. Lo veremos en la economía.

Errores comunes

  • Confundir tokens con palabras al estimar costo: en código y en español, el multiplicador engaña.
  • Asumir que un historial largo es gratis: cada turno reenvía todo como input.

Temas relacionados

Los tokens son la unidad de la ventana de contexto y de cómo cobran los proveedores.