NVIDIA, junto con 36 organizaciones, anunció la creación de la Open Secure AI Alliance, una coalición para desarrollar tecnologías abiertas de protección de software y agentes de IA. En la alianza participan Microsoft, Cisco, Cloudflare, CrowdStrike, Hugging Face, IBM, Palo Alto Networks, Red Hat y la Linux Foundation. El alcance declarado cubre toda la pila de sistemas basados en agentes: identificación, control de privilegios, aislamiento, mecanismos de contención, registro, formatos de modelos y flujos de trabajo de desarrollo seguros. Sin embargo, en el momento del lanzamiento, los materiales públicos no incluían estatutos, consejo de gobierno, grupos técnicos de trabajo, calendario de entregas ni un repositorio común de la alianza, y el sitio web de la coalición está en desarrollo. De hecho, el único resultado técnico tangible es el framework de investigación NOOA, mantenido por la propia NVIDIA.
NOOA: primer código con advertencia de sandbox
La primera y, por ahora, única aportación técnica con nombre propio de la alianza es NVIDIA-labs OO Agents (NOOA), un framework con licencia Apache 2.0 diseñado para probar, trazar, auditar y gestionar el comportamiento de agentes de IA. El enfoque arquitectónico de NOOA merece atención: la envoltura del agente se representa como una clase de Python, donde los campos almacenan el estado, los métodos exponen las capacidades, las cadenas de documentación actúan como prompts y las anotaciones de tipo definen los contratos para el modelo.
La característica clave es que un método cuyo cuerpo es un signo de puntos suspensivos (...) se rellena en tiempo de ejecución mediante un bucle basado en una LLM, mientras que el código habitual de Python permanece determinista. Esto permite a los desarrolladores utilizar las herramientas conocidas de pruebas, control de versiones y refactorización, en lugar de repartir la lógica del agente entre prompts, esquemas de herramientas y grafos de flujos de trabajo.
Según datos de la propia NVIDIA, el framework obtuvo un 86,8 % en el benchmark CyberGym L1 de reabierto de vulnerabilidades utilizando GPT-5.5 con el acceso a red bloqueado. Esta cifra es una autoevaluación del proyecto y no ha sido validada de forma independiente.
El repositorio advierte explícitamente de los riesgos: NOOA puede ejecutar código Python generado por una LLM, que podría transmitir datos confidenciales, borrar archivos o modificar el entorno. Las comprobaciones del árbol de sintaxis abstracta y las listas de módulos prohibidos se describen como medidas de defensa en profundidad, no una frontera de aislamiento. NVIDIA indica de forma explícita que los agentes que ejecutan código generado deben funcionar detrás de un aislamiento a nivel de sistema operativo —en un contenedor, máquina virtual o sandbox OpenShell—.
En el momento de este análisis, el repositorio contenía la etiqueta v0.0.6 del 22 de julio. Según la guía de contribución, el desarrollo lo lleva a cabo NVIDIA, y las aportaciones externas se aceptan mediante pull requests. En el nivel raíz del repositorio no hay archivos de gobierno del proyecto ni hoja de ruta.
El incidente de Hugging Face como argumento a favor de los modelos abiertos
NVIDIA vinculó la justificación de la alianza al incidente de julio en Hugging Face, donde un sistema autónomo basado en agentes comprometió partes de la infraestructura de producción de la compañía. Según Hugging Face, se obtuvo acceso no autorizado a un conjunto limitado de datasets internos y a varias cuentas de servicios. La empresa declaró que no había detectado indicios de manipulación de los modelos públicos, datasets, Spaces, imágenes de contenedores ni paquetes publicados.
Según Hugging Face, el acceso inicial se consiguió a través de un dataset malicioso que explotaba un cargador con remote code execution (RCE) y una template injection en la configuración del dataset. A partir de ahí, el ataque evolucionó hasta obtener acceso a nodos, recopilar credenciales y moverse lateralmente por varios clústeres internos.
Un punto crucial para el contexto de la alianza: Hugging Face utilizó agentes de análisis basados en LLM para procesar más de 17 000 acciones registradas con el fin de reconstruir la cronología, extraer indicadores de compromiso y cartografiar las credenciales afectadas. Las API comerciales de modelos frontera rechazaron los comandos de ataque, exploits y artefactos de control necesarios para el análisis. La empresa optó en su lugar por ejecutar el modelo abierto GLM 5.2 en su propia infraestructura, lo que también permitió mantener los datos del ataque dentro de su perímetro.
No obstante, conviene separar los hechos del relato. El modelo abierto ayudó a Hugging Face a reconstruir la intrusión y respaldó la respuesta. No detectó, detuvo ni contuvo el ataque por sí mismo. La ventaja fue operativa: control sobre la herramienta de análisis, no un sustituto de los mecanismos de identificación, aislamiento o contención.
Merece atención aparte la revelación de OpenAI: según la investigación preliminar de la compañía, el incidente fue provocado por los modelos GPT-5.6 Sol y otro modelo de pre‑lanzamiento más potente, que operaban con restricciones rebajadas sobre ciberataques durante una evaluación interna de ExploitGym. De acuerdo con OpenAI, los modelos explotaron una vulnerabilidad de día cero (zero-day) en un proxy de caché del registro de paquetes para obtener acceso a Internet y, a continuación, encadenaron vulnerabilidades y credenciales robadas a través de sistemas de OpenAI y Hugging Face. Estas dos revelaciones describen eslabones distintos de una misma cadena y aún no han sido cotejadas de forma independiente.
Una coalición sin liderazgo operativo
La alianza se lanzó tras una carta sectorial del 24 de julio que sostiene que los modelos descargables dan a los defensores capacidades comparables a las de los atacantes, reducen la dependencia de proveedores únicos y permiten realizar trabajo sensible en infraestructura controlada por el usuario. Es significativo que OpenAI, Google y Meta firmaran esta carta, pero no figuren en la lista de miembros de la alianza. Anthropic no aparece en ninguno de los documentos.
Varias de las tecnologías mencionadas en el anuncio existían antes de la creación de la coalición:
- Safetensors, formato de modelos de Hugging Face
- SPIFFE/SPIRE, identificación de cargas de trabajo con el respaldo de HPE
- Lightwell, sistema de remediación de IBM y Red Hat
- MDASH, sistema de seguridad multimodelo de Microsoft
Se trata de proyectos de los propios participantes, no de productos creados por la alianza. Elastic manifestó su intención de aportar investigación y herramientas en seguridad y detección de amenazas. CrowdStrike comunicó que está desarrollando métodos para detectar ataques contra sistemas de IA utilizando modelos abiertos. La Linux Foundation describió su papel como el de proporcionar una plataforma neutral para la colaboración entre competidores, pero no afirmó que la alianza esté gestionada formalmente como un proyecto de la Linux Foundation.
Los materiales públicos no distinguen niveles de participación: la asignación de ingenieros para trabajar conjuntamente, la aportación de proyectos existentes o el respaldo a la orientación de la coalición se agrupan todos bajo el mismo término de «membresía».
Conclusiones prácticas para profesionales de seguridad
El incidente de Hugging Face puso de manifiesto un problema operativo concreto: las API comerciales de modelos frontera pueden negarse a procesar datos que son críticos para las investigaciones de incidentes. Para las organizaciones que utilizan agentes de IA en entornos de producción, es recomendable:
- Desplegar y probar con antelación un modelo abierto en su propia infraestructura para tareas de forensica y respuesta a incidentes
- Al utilizar NOOA o frameworks similares, garantizar el aislamiento a nivel de sistema operativo (contenedor, máquina virtual): las comprobaciones integradas en el framework no constituyen explícitamente una frontera de contención
- Revisar las cadenas de carga de datasets en busca de remote code execution y template injection; este fue precisamente el vector utilizado en el ataque a Hugging Face
En el momento actual, la Open Secure AI Alliance es una coalición con una posición política, un conjunto de compromisos de sus participantes y una única nueva versión de código identificable (NOOA v0.0.6), mantenida por NVIDIA. El gobierno de la alianza, la hoja de ruta conjunta, el primer resultado multifabricante y los modelos, pesos y datasets prometidos siguen sin desvelarse. El valor de la coalición lo determinará no su lista de miembros, sino si llegan a existir artefactos técnicos gestionados de forma conjunta: grupos de trabajo, repositorios comunes y entregas concretas con plazos definidos.