Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Recuperacion
Árbol de habilidades

RAG

2 min de lecturaActualizado el 9 jul 2026

RAG (Retrieval-Augmented Generation, “generación aumentada por recuperación”) es el patrón más usado para que un LLM responda sobre información que no estaba en su entrenamiento: tu documentación, tu base de código, tus tickets. La idea en una frase: busca primero, responde después.

El flujo

  1. Recupera: con búsqueda semántica, encuentra los fragmentos más relevantes para la pregunta.
  2. Aumenta: los inserta en el prompt como contexto, junto a la pregunta original.
  3. Genera: el modelo responde usando ese contexto, no solo su memoria interna.
pregunta ──► recuperar top-k fragmentos ──► prompt = [fragmentos] + [pregunta] ──► LLM ──► respuesta

Por qué importa (para un dev)

  • Datos frescos y privados: respondes sobre información posterior al corte del modelo o que nunca fue pública, sin reentrenar nada.
  • Menos alucinaciones: el modelo cita material real en lugar de inventar. (No las elimina: puede malinterpretar o ignorar el contexto.)
  • Trazabilidad: puedes mostrar de qué documento salió la respuesta.
  • Coste y contexto: metes solo lo relevante en la ventana de contexto, no la base entera.

RAG vs. meter todo en el contexto

Con ventanas grandes es tentador pegar todos los documentos y ya. Problemas: cuesta más tokens, es más lento, y la atención del modelo se diluye entre tanto ruido. RAG mantiene el contexto pequeño y enfocado. Es una decisión de context engineering.

Errores comunes en producción

  • Chunking pobre: fragmentos demasiado grandes (ruido) o demasiado pequeños (pierden sentido). Es el parámetro que más mueve la calidad.
  • Recuperar poco o de más: k mal ajustado deja fuera lo relevante o inunda el prompt.
  • No evaluar la recuperación por separado: si el retrieval trae basura, el mejor modelo responde basura. Mide retrieval y generación como etapas distintas.
  • Confundir RAG con memoria del agente: RAG recupera conocimiento; la memoria de un agente persiste estado entre sesiones. Se parecen y se combinan, pero no son lo mismo.

Temas relacionados

RAG se ejecuta sobre búsqueda semántica y bases de datos vectoriales, y es un caso de context engineering. En agentes, alimenta la memoria.