La mayoría elige almacén vectorial mirando una gráfica de benchmark y luego descubre que lo que duele es el filtrado por metadatos, la multitenencia o la reindexación. Si ya tienes PostgreSQL, pgvector suele ser la respuesta correcta durante mucho más tiempo del que se cree.
El coste por token parece obviamente más barato hasta que cuentas la utilización. Las GPU facturan por hora pregunte alguien o no, y ese único hecho decide casi todas estas decisiones.
Un clasificador en cada petición cuesta tiempo y dinero en cada petición. Qué comprobar en la entrada, qué comprobar en la salida y cómo decidir si la barrera vale lo que cuesta.
Cien casos reales, métricas por tarea en vez de una puntuación única, y un juez calibrado contra etiquetas humanas. Con eso basta para cazar regresiones y decidir si un cambio de modelo es seguro.
Un paso de aprobación es el control de seguridad más barato y el más fácil de colocar mal. Demasiado pronto y no has automatizado nada; demasiado tarde y estás sellando por sellar. Cuatro colocaciones y cuándo acierta cada una.
El ajuste fino enseña comportamiento y formato. La recuperación aporta conocimiento. El prompt da forma a la tarea inmediata. Casi todos los equipos cogen la herramienta cara para arreglar un problema que esa herramienta no puede arreglar.
Los equipos cambian el modelo generador para arreglar un problema de recuperación. Los cortes de los fragmentos, el contexto que viaja con cada uno, el modelo de embeddings y un reordenador explican casi toda la diferencia de calidad.
La monitorización de siempre te dice que el flujo terminó bien. Con un modelo en medio, terminar bien y acertar son cosas distintas. Qué capturar y los tres cuadros de mando que merece la pena construir.
El Model Context Protocol convierte una API interna en algo que un agente puede llamar. El protocolo es la parte fácil; las decisiones de diseño son qué operaciones exponer, con qué granularidad y bajo qué identidad.
Los equipos discuten qué modelo usar y luego despliegan un asistente que responde con seguridad desde el documento equivocado. Lo que decide la calidad son los fragmentos, los permisos, la evaluación y el coste.
Casi toda la fricción que la gente le achaca al modelo es un párrafo que falta en el repositorio. Qué va dentro de un fichero de contexto, qué no, y por qué los que pasan de una página dejan de funcionar.
El cuello de botella se movió de escribir a revisar, y los hábitos de revisión de siempre no escalan a eso. Cuatro puertas que mantienen la calidad sin convertir a un sénior en una cola.
Uno te mantiene dentro del bucle en cada pulsación, el otro se lleva una tarea y vuelve con un diff. Casi todos los equipos que discuten cuál estandarizar acaban usando los dos, por motivos fáciles de enunciar.
Un agente de código con shell y contexto del repositorio es otra herramienta distinta del autocompletado. Las ganancias son reales y desiguales; el coste es que la revisión pasa a ser el cuello de botella. Lo que cambiamos tras seis meses.
Un asistente de código abierto que vive en tu propio servidor, te habla por la aplicación de mensajería que ya usas y ejecuta herramientas en tu nombre. Genuinamente útil, y lo más sobrepermisionado que instalará mucha gente en su vida.
El modelo casi nunca es la parte cara. Las operaciones de plataforma, las APIs a las que llamas, los reintentos y la persona que revisa la salida suelen sumar más. Un desglose real de un flujo de facturas.
Las automatizaciones fallan un martes a las tres de la mañana y no se entera nadie hasta que llama el cliente. Cuatro mecanismos —clave de idempotencia, reintentos acotados, cola de descarte y una alerta que nombre el evento de negocio— resuelven casi todo.
Un nodo de IA dentro de un flujo es un paso no determinista en una tubería determinista. Eso vale para clasificar y redactar, y es peligroso para enrutar y escribir. Aquí está dónde trazamos la línea.
En Make cada ejecución de módulo es dinero, así que el escenario más barato y el más rápido suelen ser el mismo. Cinco patrones que recortan el consumo a la mitad sin cambiar lo que hace la automatización.
Las tres hacen la misma demo. Divergen en la forma del precio, en dónde se quedan tus datos y en qué pasa cuando un flujo necesita código de verdad. Elige por eso, no por el número de conectores.
Knowledge Bases, Guardrails y Agents quitan mucha fontanería. No quitan las decisiones de recuperación, permisos y evaluación, y ahí es donde siguen fallando los proyectos.
n8n en un solo contenedor es una demo. Operarlo para una empresa significa modo cola, una base de datos de verdad, un plan para las credenciales y una restauración que hayas probado. Esta es la forma que aguanta.
Dibuje las cajas la plataforma que las dibuje, las automatizaciones que aguantan tienen las mismas tres piezas debajo. Esta es la forma y las cinco decisiones que hacen que resista bajo carga.
Un prompt es configuración de producción que cambia el comportamiento en silencio. Trátalo como código y construye la evaluación más pequeña capaz de decirte si un cambio mejoró algo.
Un agente que hace clic por una interfaz web puede automatizar sistemas que no tienen ninguna API. También es la automatización más frágil que puedes construir. Dónde cae de verdad el intercambio y cómo hacer que la versión frágil sobreviva.
No es una presentación de estrategia. Es una secuencia: encontrar el trabajo, poner en producción una cosa que importe, construir la plataforma debajo y dejar que construyan otros. Qué sale mal en cada fase y cómo saber si funciona.
Vertex te da búsqueda vectorial gestionada, una API de anclaje y un servicio de evaluación. Dos de ellas merecen tomarse tal cual. Así montamos un asistente de producción en Google Cloud.
El modelo es la parte fácil. Lo que decide si un asistente de Azure OpenAI llega a producción es la cuota de tokens por región, la red privada y si la recuperación respeta quién está preguntando.
El servicio gestionado de modelos de Oracle cubre la fontanería de un asistente estándar, incluida una base de datos con vectores que probablemente ya tienes. Esta es la arquitectura y las decisiones que no toma por ti.