Retrieval es recuperar evidencia relevante desde una colección. Es una capacidad separada de generar texto: puede probarse, medirse y mejorar antes de introducir un LLM generador. RAG funciona sólo si retrieval trae la fuente adecuada.
La generación viene después. Mantener la frontera permite saber si una mala respuesta se debe a que no llegó la fuente o a que el modelo no la utilizó bien.
Subir top-k puede mejorar recall y a la vez empeorar precisión, costo y atención. La meta no es meter más documentos, sino cubrir la respuesta con el mínimo ruido.
Construye un dataset de consultas con fragmentos relevantes esperados. Mide hit rate o recall en los primeros k, precision, posición del primer resultado útil, latencia y filtros de seguridad. Segmenta por consultas exactas, semánticas, ambiguas y sin respuesta.
También registra consultas donde no debería devolverse nada. Un recuperador que siempre encuentra algo induce al generador a responder sin evidencia.
Se apoya en Búsqueda híbrida y reranking. Cuando la evidencia recuperada se inserta en el contexto del modelo, el patrón completo es RAG.