Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Economia
Árbol de habilidades

Tokens de entrada y salida

1 min de lecturaActualizado el 9 jul 2026

Toda llamada a un LLM tiene dos contadores de tokens que se cobran por separado:

  • Entrada (input): todo lo que le mandas. Tu prompt, las instrucciones del sistema y el historial completo de la conversación que se reenvía en cada turno.
  • Salida (output): todo lo que el modelo genera.

Por qué la salida cuesta más

La salida suele valer 3 a 5 veces más por token que la entrada. La razón es técnica: la entrada se procesa de golpe en paralelo, mientras que la salida se genera token a token, cada uno dependiendo del anterior. Eso consume más cómputo secuencial y es más caro de servir.

Consecuencia práctica: pedir respuestas más cortas ahorra más que acortar el prompt.

Dónde se te va el input sin darte cuenta

  • Historial acumulado: en el turno 20 de un chat, el input incluye los 19 intercambios previos. La entrada crece sola.
  • System prompts largos: si repites un system prompt de 2.000 tokens en cada llamada, lo pagas cada vez (a menos que uses caché).
  • Documentos pegados: meter archivos enteros en el contexto se paga como input en cada turno que sigan ahí. Aquí es donde RAG ahorra dinero.

Palancas para reducir coste

PalancaEfecto
Respuestas más brevesRecorta el output caro
Resumir el historialRecorta el input acumulado
RAG en vez de pegar todoMenos input por turno
Caché de promptInput repetido más barato
Modelo menor donde alcanceBaja el precio por token de ambos

Errores comunes

  • Optimizar solo el prompt e ignorar la longitud de la salida, siendo esta la más cara.
  • Asumir simetría de precio entre input y output al estimar.

Temas relacionados

Es el detalle fino del API pricing; se mitiga con tokens en caché y buena context engineering.