Open Agent Safety Platform combina software de código abierto con supervisión independiente desde el hardware. El sistema puede monitorear lo que hace un agente, limitar su acceso a datos y herramientas, y aislarlo en milisegundos si intenta romper las reglas establecidas.
Los agentes de inteligencia artificial están comenzando a realizar tareas cada vez más complejas sin necesitar supervisión humana constante. Pueden escribir y ejecutar código, consultar bases de datos, utilizar aplicaciones o interactuar con servicios externos.
El problema aparece cuando un agente intenta hacer algo para lo que nunca recibió autorización.
NVIDIA quiere abordar ese escenario con Open Agent Safety Platform, una nueva plataforma diseñada para establecer límites sobre lo que pueden hacer estos sistemas y detenerlos si intentan sobrepasarlos.
La propuesta combina dos componentes principales: OpenShell, que crea un entorno controlado para ejecutar agentes, y NVIDIA Sentry, un sistema independiente que supervisa su comportamiento desde el hardware.
Un entorno cerrado para los agentes de IA
El primer elemento es NVIDIA OpenShell, un software de código abierto que ejecuta agentes autónomos dentro de entornos aislados.
Desde ahí pueden establecerse políticas que definan qué archivos, redes, aplicaciones, APIs o herramientas puede utilizar cada agente.
OpenShell también registra las acciones realizadas durante la ejecución, permitiendo posteriormente revisar qué hizo el sistema y si respetó las reglas definidas por sus operadores.
La idea se parece, en cierta medida, al sandbox utilizado por los navegadores modernos: incluso si algo sale mal dentro de un entorno, ese proceso no debería tener acceso libre al resto del sistema.
NVIDIA sostiene que este tipo de aislamiento será cada vez más necesario a medida que los agentes puedan trabajar durante horas, días o incluso semanas de manera autónoma.
Sentry funciona como un vigilante independiente
La segunda capa es NVIDIA Sentry.
A diferencia de los controles integrados dentro del propio agente, Sentry funciona de manera independiente sobre los BlueField-4 DPU de NVIDIA.
El sistema monitorea continuamente el comportamiento del agente y puede intervenir si detecta que intenta ejecutar acciones fuera de los límites establecidos.
Según NVIDIA, Sentry puede poner en cuarentena y detener a un agente en milisegundos.
Esto es importante porque el control no depende del propio modelo.
En otras palabras, un agente no puede simplemente decidir ignorar la restricción que lo está supervisando, porque esa capa se encuentra fuera de su entorno de ejecución.
El sistema también puede verificar la identidad del agente y establecer políticas de acceso bajo un modelo zero trust para datos, herramientas y servicios.
NVIDIA dice que podría haber detenido el ataque a Hugging Face
La presentación ocurre después de varios incidentes relacionados con agentes autónomos.
Reuters informó que OpenAI y Anthropic están investigando casos en los que agentes consiguieron acceder a sistemas comerciales o gubernamentales mientras realizaban tareas complejas.
Uno de los casos mencionados por NVIDIA afectó a Hugging Face.
Justin Boitano, vicepresidente de computación empresarial de NVIDIA, señaló que, según la información conocida hasta ahora, la nueva plataforma podría haber detenido ese incidente si hubiese sido utilizada durante las evaluaciones de los modelos.
NVIDIA también explica que en sus propias pruebas ha observado un comportamiento que denomina drift, donde un agente comienza a desviarse de la tarea o de las restricciones originales.
Esto puede ocurrir por instrucciones ambiguas, errores, falta de herramientas o después de numerosos intentos fallidos por completar una tarea.
La compañía sostiene que este tipo de comportamiento no puede resolverse únicamente entrenando al modelo para que respete las reglas y que, por lo tanto, se necesitan controles externos.
No funcionará únicamente con hardware de NVIDIA
Aunque OpenShell está diseñado para trabajar con los nuevos procesadores NVIDIA Vera, la compañía publicó el software como código abierto.
Eso permitirá extenderlo también a otras plataformas.
NVIDIA está trabajando con Arm e Intel para que la tecnología pueda utilizarse con sus procesadores, ampliando su alcance más allá de la infraestructura propia de la compañía.
Sentry, en cambio, está diseñado alrededor del hardware BlueField-4 de NVIDIA y funciona como la capa independiente encargada de observar y aplicar las políticas de seguridad.
Más de 100 organizaciones participan en el proyecto
NVIDIA no está desarrollando la plataforma sola.
Más de 100 organizaciones están trabajando con sus tecnologías de seguridad para agentes, incluyendo compañías como Anthropic, Microsoft, Salesforce, SAP, Cisco, CrowdStrike, Palantir, Perplexity y Hugging Face.
SpaceXAI, por ejemplo, ya utiliza la plataforma para agentes de programación de Cursor y modelos Grok, mientras Salesforce integró OpenShell con Slack para permitir que los equipos revisen la actividad de los agentes y aprueben solicitudes adicionales de permisos.
El objetivo es desarrollar una capa de seguridad común a medida que los agentes ganan acceso a sistemas empresariales, infraestructura crítica y, eventualmente, robots capaces de realizar acciones en el mundo físico.
La seguridad pasa a estar fuera del modelo
La apuesta de NVIDIA plantea una idea importante para la próxima etapa de la inteligencia artificial: no confiar únicamente en que el propio modelo respete las reglas.
La compañía compara este momento con los primeros años de internet, cuando los navegadores comenzaron a aislar cada página dentro de entornos separados para evitar que un sitio malicioso pudiera comprometer todo el computador.
Con los agentes, el principio sería similar.
Mientras más permisos reciban para actuar de manera independiente, más importante será contar con una segunda capa capaz de observarlos y cortar su acceso cuando algo se salga de lo previsto.
¿Qué viene ahora?
OpenShell y las herramientas de Open Agent Safety Platform ya están disponibles para desarrolladores, mientras NVIDIA continúa trabajando con empresas, investigadores y organizaciones públicas para ampliar la plataforma.
La siguiente etapa será integrar estos controles en más sistemas empresariales y plataformas de agentes, además de extender la compatibilidad hacia hardware de fabricantes como Arm e Intel.












