Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Fundamentos
Árbol de habilidades

Ventana de contexto

2 min de lecturaActualizado el 9 jul 2026

La ventana de contexto es la cantidad máxima de tokens que un modelo puede tener “a la vista” en una misma llamada: tu mensaje, las instrucciones del sistema, el historial de la conversación y su propia respuesta, todo junto. Si algo no cabe en la ventana, el modelo no lo ve. Punto.

Por qué es el límite que más notas

Casi todos los comportamientos raros de “memoria” salen de aquí:

  • “Se olvidó de lo que le dije al principio”: en una conversación larga, los primeros mensajes se empujan fuera de la ventana. No es que los ignore; es que ya no están.
  • “Cada turno va más lento y más caro”: todo el historial se reenvía como input en cada turno (ver tokens). Cuanto más largo, más pesado.
  • “Le pasé un archivo enorme y falló”: superó la ventana.

Las ventanas han crecido mucho (de miles a cientos de miles de tokens, y algunos modelos llegan al millón), pero más grande no es gratis ni infalible: cuesta más y la atención del modelo se diluye cuando el contexto está saturado.

La ventana no es memoria persistente

Clave: cuando cierras la conversación, el modelo no recuerda nada. La “memoria” aparente es solo el historial que el harness le vuelve a enviar dentro de la ventana. Por eso existen mecanismos externos para dar continuidad:

  • Reenviar un resumen del historial en lugar del historial completo.
  • Recuperar por búsqueda vectorial solo los fragmentos relevantes (RAG) en vez de meter todo.
  • Archivos de contexto persistente que el harness inyecta en cada sesión.

El puente hacia los harnesses

Esto explica directamente una pieza del bloque 3: CLAUDE.md. Es un archivo que Claude Code carga al principio de cada sesión para que instrucciones y contexto del proyecto siempre entren en la ventana, sin que tengas que repetirlos. Un buen harness gestiona activamente qué entra y qué sale de la ventana: eso es context engineering, y es la mitad del arte de trabajar con agentes.

Cuándo te topas con el límite

  • Conversaciones muy largas → resúmelas o empieza de nuevo.
  • Documentos grandes → trocéalos y recupera solo lo relevante.
  • Muchos archivos en un agente → deja que el harness lea bajo demanda, no todo de golpe.

Temas relacionados

La ventana se mide en tokens, su gestión conecta con CLAUDE.md y con la gestión de contexto de los harnesses.