OCI Generative AI: dónde encaja y qué se construye alrededor

El servicio gestionado de modelos de Oracle cubre la fontanería de un asistente estándar, incluida una base de datos con vectores que probablemente ya tienes. Esta es la arquitectura y las decisiones que no toma por ti.

Si tus datos ya están en Oracle Cloud, el argumento para ejecutar el asistente allí es el de siempre: sin salida de datos, sin una segunda conversación de cumplimiento y con un único modelo de identidad. La pila de IA generativa de OCI es más pequeña que las equivalentes de las otras nubes, y para un asistente estándar con recuperación resulta que eso importa poco.

Estas son las piezas y dónde está el trabajo de verdad.

Las piezas

OCI Generative AI es el servicio gestionado de inferencia: modelos alojados disponibles bajo demanda, más clústeres de IA dedicados cuando necesitas capacidad garantizada y latencia predecible. El modelo de clúster dedicado conviene entenderlo pronto porque es la diferencia entre un SLA que puedes prometer y uno que no.

Generative AI Agents es el servicio gestionado de RAG. Lo apuntas a una fuente de datos y se encarga de la ingesta, la recuperación y las respuestas ancladas con citas. Para un asistente de documentación sobre contenido en Object Storage, esto es casi toda la construcción.

23ai con AI Vector Search es la pieza que cambia la arquitectura. Oracle Database 23ai almacena vectores como tipo nativo y los consulta en SQL junto a tus datos relacionales. Si tus datos operativos ya están en Oracle, esto elimina un componente entero: no hay una base de datos vectorial aparte que operar, sincronizar y asegurar y, más importante, la recuperación puede unir una búsqueda por similitud vectorial con una tabla de permisos o un filtro de negocio en una sola consulta.

Esa última propiedad es el argumento técnico más fuerte de la pila. El fallo común en sistemas RAG es que el almacén vectorial no sabe nada de tu modelo de permisos. Un índice vectorial dentro de la base de datos que ya contiene tus listas de control de acceso no tiene ese problema.

Select AI te permite consultar tus datos en lenguaje natural a través de la base de datos, generando SQL. Útil para herramientas de analistas y con un perfil de riesgo completamente distinto al de un asistente documental: necesita su propio usuario de solo lectura, su propia seguridad a nivel de fila y un límite duro sobre lo que puede tocar.

Lo que sigues decidiendo tú

El servicio gestionado quita fontanería, no criterio. Las cuatro decisiones de lo que decide un proyecto de RAG siguen ahí:

Troceado para tus tipos de documento. El troceado por defecto se apaña con prosa y destroza tablas y contratos. Si tu corpus es estructurado, cuenta con escribir tu propio paso de ingesta que mantenga las cabeceras de sección pegadas a los fragmentos.

Permisos en el momento de recuperar. Si distintos usuarios deben ver distintos documentos, el filtro se aplica en la consulta de recuperación, no después. Con 23ai eso es una cláusula WHERE contra tus datos de autorización existentes, que es la versión más fácil de este problema disponible en ningún sitio. Con fuentes en Object Storage es filtrado por metadatos y mantenerlo sincronizado es tuyo.

Recuperación híbrida. La búsqueda solo vectorial se pierde los identificadores exactos — referencias de pieza, códigos de error, referencias de cliente. Combínala con búsqueda por palabra clave; en 23ai eso es un índice de texto junto al índice vectorial, en una consulta.

Evaluación. De cincuenta a doscientas preguntas reales con la fuente correcta para cada una, ejecutadas en cada cambio. Nada del servicio gestionado escribe esto por ti y nada más te dice si un cambio ayudó.

Identidad y coste

Usa principales de recurso y grupos dinámicos para que la aplicación se autentique contra el servicio de IA generativa sin ninguna credencial — el patrón de las políticas y grupos dinámicos de OCI. Acota la política al compartimento concreto.

Sobre el coste: inferencia bajo demanda para pilotos y carga variable, clústeres de IA dedicados cuando tengas volumen estable y un requisito de latencia. Sigue el coste por pregunta etiquetado por equipo desde la primera semana, cachea los embeddings del contenido sin cambios y usa un modelo pequeño para reescribir consultas y clasificar. La economía es la misma en todas partes; lo que cambia en OCI es que la línea de salida es menor, lo que importa cuando el asistente sirve respuestas con muchos datos.

Cuándo elegirlo

Elige la pila de OCI cuando tus datos y tus usuarios ya estén allí, en particular cuando tu sistema de registro sea Oracle Database — la integración vectorial de 23ai es una simplificación arquitectónica real, no una función de marketing.

Elige otra cosa cuando necesites un modelo concreto que OCI no aloja, cuando tu equipo ya haya construido sobre las herramientas de otro proveedor, o cuando el panorama de modelos se mueva más rápido de lo que quieres estar atado a la selección alojada de un solo fabricante. Mantener la capa de recuperación separada de la de generación es la cobertura que abarata ese cambio, y así los construimos con independencia del proveedor en los proyectos de IA aplicada.

Qué hacer esta semana

Escribe el conjunto de evaluación: cincuenta preguntas reales de usuarios reales, cada una con el documento que debería responderla. Y después, por separado, mira dónde viven tus datos de autorización. Si la respuesta es "en la misma base de datos que el contenido", tienes disponible un diseño de recuperación bastante más simple que el de la mayoría de equipos.

ConsultorIA

¿Quieres esto en tu nube?

El diagnóstico de diez días en solo lectura es gratuito, y con Skyline puedes ver tu entorno en un mapa antes de escribirnos.

Artículos relacionados