Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Agentes
Árbol de habilidades

Memory

1 min de lecturaActualizado el 9 jul 2026

Un LLM no recuerda nada por sí mismo: cerrada la llamada, olvida (ver ventana de contexto). La memoria de un agente es todo lo que el harness hace para dar continuidad pese a esa amnesia.

Dos niveles de memoria

1. Memoria de trabajo (dentro de la sesión). Es el historial que cabe en la ventana de contexto durante la tarea actual. El harness la gestiona con context engineering: resume lo viejo, mantiene lo relevante, descarta ruido.

2. Memoria persistente (entre sesiones). Información que sobrevive al cierre y se reinyecta en sesiones futuras:

  • Archivos de contexto como CLAUDE.md: notas de proyecto que se cargan siempre.
  • Almacenes de memoria: hechos que el agente guarda (“el usuario prefiere TypeScript”) y recupera después.
  • Recuperación por RAG: traer de una base externa solo lo que aplica a la tarea, en lugar de cargar todo.

Memoria vs. RAG (no confundir)

Se solapan pero no son lo mismo:

  • RAG recupera conocimiento (documentación, código) para responder mejor.
  • Memoria persiste estado y preferencias del propio agente/usuario a lo largo del tiempo.

En la práctica, la memoria persistente suele implementarse con las mismas piezas que el RAG (embeddings + búsqueda), pero el propósito es distinto.

Buenas prácticas

  • Guardar poco y bueno: memoria inflada es contexto inflado; cuesta y distrae.
  • Hacerla inspeccionable: que puedas ver y editar qué “recuerda” el agente.
  • Separar por proyecto: no mezclar memoria de repos o clientes distintos.

Errores comunes

  • Tratar la ventana de contexto como memoria permanente: desaparece al cerrar.
  • Acumular memoria sin límite: degrada calidad y sube coste.

Temas relacionados

Se apoya en context engineering y RAG; una implementación concreta es CLAUDE.md.