Una base de datos vectorial almacena embeddings y responde una pregunta muy concreta muy rápido: “¿cuáles son los k vectores más parecidos a este?” Es la infraestructura sobre la que corren la búsqueda semántica y el RAG.
Comparar la consulta contra todos los vectores uno por uno (búsqueda exacta) no escala a millones de documentos. Por eso usan índices ANN (Approximate Nearest Neighbor): sacrifican un poco de exactitud a cambio de respuestas en milisegundos. Algoritmos típicos: HNSW, IVF.
En producción casi nunca buscas solo por similitud. Estas bases añaden:
pgvector (PostgreSQL), Redis, Elasticsearch/OpenSearch.[!TIP] Si ya usas Postgres y tu volumen es moderado,
pgvectorsuele ser suficiente y te ahorra una pieza de infraestructura. No metas una base vectorial dedicada por defecto.
pgvector bastaba.Guardan vectores y sirven a búsqueda semántica y RAG.