Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Economia
Árbol de habilidades

Tokens en caché

1 min de lecturaActualizado el 9 jul 2026

El prompt caching permite que el proveedor guarde una parte del contexto ya procesada y la reutilice en llamadas siguientes, cobrándola mucho más barata que un token de entrada normal. Es la optimización de coste más fácil de aplicar cuando repites contexto.

El problema que resuelve

En muchos usos, buena parte de la entrada es idéntica llamada tras llamada: un system prompt largo, las instrucciones de una herramienta, un documento de referencia, el historial de un chat. Sin caché lo pagas completo cada vez. Con caché, esa parte estable se cobra a una fracción del precio.

Cómo funciona (a grandes rasgos)

  • Marcas (o el proveedor detecta) el prefijo estable del prompt.
  • La primera llamada lo procesa y lo cachea (a veces con un pequeño sobrecoste de escritura).
  • Las llamadas siguientes que empiezan igual reutilizan ese trabajo: lectura de caché a precio reducido.
  • La caché expira tras un tiempo de inactividad (minutos), así que ayuda cuando las llamadas están cerca en el tiempo.

Regla de oro: lo estable va al principio del prompt; lo variable, al final. Cualquier cambio en el prefijo invalida la caché desde ese punto.

Dónde brilla

  • Agentes: repiten un system prompt e instrucciones enormes en cada paso del loop. La caché los abarata drásticamente.
  • Chats largos: el historial estable se cachea entre turnos.
  • RAG con contexto fijo: documentos que se reutilizan entre consultas.

[!NOTE] Esto explica un detalle de los coding agents: mantener la conversación “caliente” (llamadas seguidas) aprovecha la caché; esperar demasiado la deja expirar y la siguiente llamada vuelve a costar completa.

Errores comunes

  • Poner contenido variable al inicio del prompt: rompe la caché en cada llamada.
  • Contar con la caché para llamadas muy espaciadas: ya expiró.

Temas relacionados

Reduce el coste de la entrada del API pricing y es clave en el agentic loop.