Innovaciones clave en la cartera de Red Hat AI ofrecen confianza verificable, control operativo, arquitecturas estandarizadas y transparencia de rendimiento necesarios para ejecutar la IA como un servicio empresarial compartido
Red Hat, el principal proveedor mundial de soluciones de código abierto, ha anunciado actualizaciones significativas en toda la cartera de Red Hat AI con el lanzamiento de Red Hat AI 3.5. A medida que los equipos empresariales van más allá de la experimentación inicial y el éxito de los proyectos piloto, los líderes de TI e ingeniería de plataformas se enfrentan al desafío de ejecutar la IA con el mismo rigor operativo que las infraestructuras de misión crítica. Al ofrecer la base escalable necesaria para controlar, proteger y observar estas cargas de trabajo en la nube híbrida, Red Hat AI 3.5 reduce la brecha entre los pilotos de IA aislados y una arquitectura empresarial plenamente gobernada.
¿Qué es Red Hat AI 3.5?
Red Hat AI 3.5 ofrece la base operativa que las organizaciones necesitan para escalar la IA en producción y extenderla en entornos híbridos a través de nuevas capacidades de seguridad y observabilidad. Con esta versión, las organizaciones pueden verificar modelos antes de su despliegue a través de EvalHub, lo que permite realizar pruebas comparativas de seguridad enfocadas en los riesgos y generar certificaciones de cumplimiento normativo. Los nuevos paneles de observabilidad proporcionan a los equipos de plataforma métricas integrales para obtener información en tiempo real sobre el estado de la inferencia, la utilización de las GPU y el rendimiento de los modelos de IA. Los usuarios sin permisos de administración pueden acceder a paneles para el reparto interno de costes del consumo de tokens por usuario y a cargas de trabajo de inferencia distribuida.
Además, Red Hat AI 3.5 amplía las capacidades probadas de la plataforma empresarial para ofrecer un soporte multinquilino mejorado para proveedores de servicios de IA y casos de uso de IA que requieren un aislamiento completo de hardware a software, así como un servicio orientado a la prioridad con arquitectura multinquilino nativa para infraestructura de GPU compartida. Para las organizaciones que requieren de un mayor aislamiento entre inquilinos, Red Hat AI ahora admite oficialmente la ejecución en planos de control alojados de Red Hat OpenShift desplegados sobre Red Hat OpenShift Virtualization. Los planos de control alojados proporcionan a cada inquilino un plano de control de clúster dedicado al tiempo que consolidan el hardware subyacente. La ejecución de cargas de trabajo de IA en máquinas virtuales de Red Hat OpenShift Virtualization añade un aislamiento robusto a nivel de máquina virtual en toda la infraestructura compartida con capacidad para GPU. Juntas, estas capacidades permiten a los proveedores de infraestructura operar y actualizar todo el entorno subyacente desde un único punto de control.
Red Hat AI 3.5 también acelera el camino hacia agentes de IA gobernados. AutoRAG conecta los repositorios de datos empresariales directamente con las aplicaciones agénticas, introduciendo capacidades avanzadas como soporte para documentos multilingües, pruebas conversacionales y recuperación contextual. Un pipeline visual ofrece confianza a los equipos en sus configuraciones de RAG antes del despliegue. Las plantillas de agentes proporcionan implementaciones preconfiguradas para patrones comunes como la revisión de código, el procesamiento de documentos y los flujos de trabajo de investigación. Una vez desplegado, Inference-Time Scaling (ITS) optimiza el gasto en GPU ajustando la computación dinámicamente según la complejidad de la consulta.
¿Por qué es importante Red Hat AI 3.5?
Conforme los pilotos de IA empresarial tienen éxito y los resultados iniciales muestran retornos prometedores, los equipos de TI deben abordar la necesidad de ofrecer soluciones a escala. Pero escalar la IA en toda la empresa exige el mismo rigor operativo que cualquier infraestructura de misión crítica: seguridad verificada antes del despliegue, controles de recursos precisos en entornos de GPU compartidos, comportamiento de agentes gobernados y métricas de uso transparentes. Hoy en día, la mayoría de las organizaciones afrontan estos retos con herramientas fragmentadas y procesos manuales que no escalan. Red Hat AI 3.5 resuelve esta carencia unificando la seguridad, el soporte multinquilino, el desarrollo agéntico y la observabilidad en una única plataforma empresarial. El resultado es una IA que opera como una arquitectura de IA responsable y gobernada —no como un experimento aislado— en entornos de nube híbrida.
Declaraciones de Red Hat
“La conversación ha pasado de llevar la IA a producción a ejecutarla a escala como una infraestructura empresarial de confianza, lo que requiere evidencias de seguridad, agentes gobernados, atribución de costes y soporte multinquilino”, asegura Joe Fernandes, vice president and general manager, AI Business Unit, Red Hat. “Con Red Hat AI 3.5, ofrecemos los controles operativos, la confianza verificable y las bases agénticas que los líderes de TI necesitan para ejecutar la IA como una arquitectura de IA empresarial segura, controlada y responsable en la nube híbrida”.
Principales novedades:
- Evaluación y seguridad verificables antes del despliegue: Los modelos evaluados del catálogo incluyen puntuaciones de referencia integradas con Garak, mientras que la disponibilidad general de EvalHub automatiza los informes de seguridad y cumplimiento auditable para modelos personalizados, RAG y agentes.
- Control de GPU compartida para inferencia multinquilino: La planificación equitativa de GPU gestiona la asignación de recursos entre inquilinos, mientras que el servicio orientado a la prioridad proporciona control de admisión y enrutamiento de peticiones basado en prioridades para proteger la inferencia en tiempo real y permitir que las cargas de trabajo en segundo plano aprovechen la capacidad disponible.
- API para agentes y seguridad de pasarela: La disponibilidad general de soporte para Responses API y RAG integrado ofrece una interfaz unificada de código abierto para conversaciones agénticas de varios turnos, reforzada por NeMo Guardrails integrado que intercepta llamadas a herramientas maliciosas.
- Anclaje en datos empresariales y razonamiento eficiente: AutoRAG con soporte para pgvector, AutoML nativo e Inference-Time Scaling permiten que los modelos adapten dinámicamente el uso de computación según la dificultad de la consulta.
- Observabilidad integrada y asignación de costes de MaaS: Ofrece medición de consumo de tokens por usuario, paneles de rendimiento para modelos y agentes, trazado agéntico visual con MLflow y paneles de utilización de GPU para obtener una clara transparencia operativa y de uso.
- Plantillas de agentes prediseñadas para un desarrollo más rápido: AI Hub introduce plantillas de agentes y kits de inicio con implementaciones de referencia preconfiguradas para patrones empresariales comunes, incluyendo revisión de código, procesamiento de documentos y flujos de trabajo de investigación.
Más detalles
- Soporte para planos de control alojados y OpenShift Virtualization para un mejor aprovechamiento de recursos en entornos multinquilino: Red Hat AI ahora admite oficialmente planos de control alojados, proporcionando a cada inquilino un plano de control dedicado y una mayor consolidación del hardware. El soporte para cargas de trabajo de IA en máquinas virtuales de OpenShift Virtualization permite que múltiples inquilinos compartan servidores físicos con un sólido aislamiento a nivel de máquina virtual.
- Nuevo conjunto de modelos validados con puntuaciones de seguridad de IA: Se han añadido más de 20 modelos validados nuevos al catálogo, incluidos modelos de Google (Gemma 4), NVIDIA (Nemotron 3), Alibaba Cloud (Qwen), entre otros. Estos modelos validados cuentan con evaluaciones comparativas de rendimiento completas e incluyen ahora puntuaciones integradas de seguridad de Garak, exposición a datos personales (PII) y riesgo de toxicidad, ofreciendo total transparencia a las empresas que evalúan los riesgos de los modelos de IA.
- Modelos validados para llamadas a herramientas: Un grupo seleccionado de modelos validados ha sido etiquetado en el catálogo como verificado para llamadas a herramientas, ofreciendo a los clientes confianza al elegir un modelo para casos de uso agénticos.
- Gestión de tráfico y actualizaciones seguras de modelos: El servicio orientado a la prioridad proporciona control de admisión y enrutamiento de peticiones por prioridad para proteger la inferencia en tiempo real mientras se permite que las cargas en segundo plano utilicen la capacidad disponible, y el despliegue controlado de modelos gestiona el tráfico durante las actualizaciones de modelos, permitiendo transiciones seguras con la mínima interrupción del servicio.
- Gestión eficiente de la memoria GPU: La disponibilidad general de descarga a CPU y la vista previa para desarrolladores de descarga a almacenamiento permiten a los modelos gestionar conversaciones más largas y documentos de mayor tamaño sin necesidad de hardware de GPU adicional.
- Servicio multimodal: Ofrece generación de texto, audio e imágenes desde una capa de servicio unificada mediante vLLM Omni (disponible en acceso anticipado)
- Servicio de modelos en Kubernetes multinube: Extiende la inferencia distribuida llm-d más allá de OpenShift hacia servicios de Kubernetes de terceros, ofreciendo una experiencia uniforme de servicio de modelos en distintas nubes. Ya disponible con carácter general en CoreWeave CKS y Microsoft Azure, e incorporando Amazon EKS como vista previa tecnológica.
- Kits de desarrollo de agentes: AI Hub introduce plantillas de agentes y kits de inicio preconfigurados para patrones empresariales comunes, tales como revisión de código, procesamiento de documentos y flujos de trabajo de investigación, integrando marcos de trabajo, herramientas y configuraciones de despliegue para ejecutarse en entornos aislados (sandboxed) manteniendo intactos los controles operativos y las políticas de seguridad desde el primer despliegue hasta la fase de producción.
- Workbench de datos empresariales: Kubeflow Spark Operator, disponible como vista previa para desarrolladores, integra el procesamiento distribuido de datos directamente en el entorno de trabajo activo, unificando la preparación de datos y el servicio de modelos en una sola plataforma.
- GPU como servicio y soporte multinquilino: Incluye aislamiento por namespaces, compatibilidad con planos de control alojados y visibilidad en tiempo real mediante paneles sobre el inventario de hardware, la utilización activa y el préstamo dinámico de capacidad de GPU.










