La mayoría elige almacén vectorial mirando una gráfica de benchmark y luego descubre que lo que duele es el filtrado por metadatos, la multitenencia o la reindexación. Si ya tienes PostgreSQL, pgvector suele ser la respuesta correcta durante mucho más tiempo del que se cree.
Los equipos cambian el modelo generador para arreglar un problema de recuperación. Los cortes de los fragmentos, el contexto que viaja con cada uno, el modelo de embeddings y un reordenador explican casi toda la diferencia de calidad.
Los equipos discuten qué modelo usar y luego despliegan un asistente que responde con seguridad desde el documento equivocado. Lo que decide la calidad son los fragmentos, los permisos, la evaluación y el coste.
Knowledge Bases, Guardrails y Agents quitan mucha fontanería. No quitan las decisiones de recuperación, permisos y evaluación, y ahí es donde siguen fallando los proyectos.
Vertex te da búsqueda vectorial gestionada, una API de anclaje y un servicio de evaluación. Dos de ellas merecen tomarse tal cual. Así montamos un asistente de producción en Google Cloud.
El modelo es la parte fácil. Lo que decide si un asistente de Azure OpenAI llega a producción es la cuota de tokens por región, la red privada y si la recuperación respeta quién está preguntando.