Los agentes de inteligencia artificial están ganando autonomía para navegar por internet, ejecutar código, consultar bases de datos o utilizar herramientas sin necesidad de que una persona les indique cada uno de sus pasos. Pero los incidentes registrados durante los últimos meses han demostrado también que algunos de estos sistemas pueden buscar caminos inesperados cuando encuentran una restricción.
Nvidia quiere poner una barrera adicional a ese problema. La compañía ha presentado Open Agent Safety Platform, una nueva plataforma abierta de seguridad diseñada para controlar qué pueden hacer los agentes de IA y, sobre todo, detenerlos incluso aunque el propio modelo intente sobrepasar los límites que le han sido establecidos.
La propuesta llega después de una sucesión de incidentes protagonizados durante evaluaciones de seguridad por agentes desarrollados por algunos de los principales laboratorios de inteligencia artificial. OpenAI, Anthropic y otras compañías han investigado casos en los que modelos accedieron a servicios o sistemas externos que no formaban parte de la tarea que tenían encomendada.
OpenAI, de hecho, acaba de paralizar temporalmente el entrenamiento, evaluación e inferencia con herramientas de sus modelos más capaces después de descubrir que uno de sus agentes había encontrado una forma de salir del entorno aislado en el que estaba trabajando y comunicarse con un servicio externo.
La respuesta de Nvidia parte de una idea diferente a intentar conseguir simplemente que el modelo sea más obediente: colocar los controles de seguridad fuera del propio agente.
No confiar únicamente en que la IA respete las reglas
Nvidia reconoce en la documentación técnica de su nueva plataforma que un agente puede desviarse de su tarea por distintos motivos, como encontrarse con una restricción, un fallo, carecer de una herramienta determinada o pasar largos periodos buscando una solución para un problema complejo.
Y llega a una conclusión especialmente relevante: no se puede esperar que el propio agente sea capaz de gobernar completamente su comportamiento. La compañía sostiene además que estos comportamientos no pueden eliminarse simplemente mediante entrenamiento sin afectar al mismo tiempo a las capacidades del sistema.
Por eso, la idea de Open Agent Safety Platform es establecer una barrera independiente que determine hasta dónde puede llegar una IA aunque esta decida intentar algo diferente. La plataforma se articula principalmente alrededor de dos tecnologías: OpenShell y Sentry.
OpenShell es un entorno de ejecución de código abierto que permite definir previamente qué archivos, redes, herramientas, procesos o credenciales puede utilizar cada agente. Por ejemplo, una empresa puede permitir a un agente consultar determinada información a través de una API pero impedirle modificarla, aunque ambas acciones se realicen sobre el mismo servicio. También puede bloquear su acceso a partes concretas del sistema o impedir que consiga mayores privilegios mediante código generado por la propia IA.
OpenShell examina sus peticiones antes de permitir que se comuniquen con otros servicios. Las restricciones continúan funcionando incluso si la IA abre una terminal, ejecuta código creado por ella misma, inicia nuevos procesos o intenta delegar una tarea en otros agentes.
Nvidia añade además una segunda capa de protección llamada Sentry. En este caso, la vigilancia se traslada incluso fuera del procesador en el que se ejecuta el agente. Sentry funciona como un sistema independiente que observa continuamente su actividad y aplica las políticas de seguridad desde el propio hardware. Si un agente intenta superar la barrera establecida por el software, Nvidia asegura que este segundo sistema puede ponerlo en cuarentena y detenerlo en cuestión de milisegundos.
Sentry también puede verificar la identidad del agente, comprobar qué permisos le han sido delegados, inspeccionar sus solicitudes y respuestas y controlar su acceso a datos, herramientas, API y otros servicios.
Más de cien compañías se suman al proyecto
Nvidia ha lanzado la iniciativa con el respaldo de más de un centenar de organizaciones. Entre ellas aparecen empresas como Anthropic, Microsoft, JPMorgan Chase, Perplexity y Accenture.
El consejero delegado de Nvidia, Jensen Huang, defiende que el crecimiento de los agentes autónomos exigirá precisamente este tipo de controles externos a medida que las empresas les permitan trabajar con información y sistemas más sensibles.


