Nvidia crea un sistema para frenar a los agentes de IA cuando se saltan sus límites: puede detenerlos en milisegundos

Publicado el

spot_img

Los agentes de inteligencia artificial están ganando autonomía para navegar por internet, ejecutar código, consultar bases de datos o utilizar herramientas sin necesidad de que una persona les indique cada uno de sus pasos. Pero los incidentes registrados durante los últimos meses han demostrado también que algunos de estos sistemas pueden buscar caminos inesperados cuando encuentran una restricción.

Nvidia quiere poner una barrera adicional a ese problema. La compañía ha presentado Open Agent Safety Platform, una nueva plataforma abierta de seguridad diseñada para controlar qué pueden hacer los agentes de IA y, sobre todo, detenerlos incluso aunque el propio modelo intente sobrepasar los límites que le han sido establecidos.

La propuesta llega después de una sucesión de incidentes protagonizados durante evaluaciones de seguridad por agentes desarrollados por algunos de los principales laboratorios de inteligencia artificial. OpenAI, Anthropic y otras compañías han investigado casos en los que modelos accedieron a servicios o sistemas externos que no formaban parte de la tarea que tenían encomendada.

OpenAI, de hecho, acaba de paralizar temporalmente el entrenamiento, evaluación e inferencia con herramientas de sus modelos más capaces después de descubrir que uno de sus agentes había encontrado una forma de salir del entorno aislado en el que estaba trabajando y comunicarse con un servicio externo.

La respuesta de Nvidia parte de una idea diferente a intentar conseguir simplemente que el modelo sea más obediente: colocar los controles de seguridad fuera del propio agente.

No confiar únicamente en que la IA respete las reglas

Nvidia reconoce en la documentación técnica de su nueva plataforma que un agente puede desviarse de su tarea por distintos motivos, como encontrarse con una restricción, un fallo, carecer de una herramienta determinada o pasar largos periodos buscando una solución para un problema complejo.

Y llega a una conclusión especialmente relevante: no se puede esperar que el propio agente sea capaz de gobernar completamente su comportamiento. La compañía sostiene además que estos comportamientos no pueden eliminarse simplemente mediante entrenamiento sin afectar al mismo tiempo a las capacidades del sistema.

Por eso, la idea de Open Agent Safety Platform es establecer una barrera independiente que determine hasta dónde puede llegar una IA aunque esta decida intentar algo diferente. La plataforma se articula principalmente alrededor de dos tecnologías: OpenShell y Sentry.

OpenShell es un entorno de ejecución de código abierto que permite definir previamente qué archivos, redes, herramientas, procesos o credenciales puede utilizar cada agente. Por ejemplo, una empresa puede permitir a un agente consultar determinada información a través de una API pero impedirle modificarla, aunque ambas acciones se realicen sobre el mismo servicio. También puede bloquear su acceso a partes concretas del sistema o impedir que consiga mayores privilegios mediante código generado por la propia IA.

OpenShell examina sus peticiones antes de permitir que se comuniquen con otros servicios. Las restricciones continúan funcionando incluso si la IA abre una terminal, ejecuta código creado por ella misma, inicia nuevos procesos o intenta delegar una tarea en otros agentes.

Nvidia añade además una segunda capa de protección llamada Sentry. En este caso, la vigilancia se traslada incluso fuera del procesador en el que se ejecuta el agente. Sentry funciona como un sistema independiente que observa continuamente su actividad y aplica las políticas de seguridad desde el propio hardware. Si un agente intenta superar la barrera establecida por el software, Nvidia asegura que este segundo sistema puede ponerlo en cuarentena y detenerlo en cuestión de milisegundos.

Sentry también puede verificar la identidad del agente, comprobar qué permisos le han sido delegados, inspeccionar sus solicitudes y respuestas y controlar su acceso a datos, herramientas, API y otros servicios.

Más de cien compañías se suman al proyecto

Nvidia ha lanzado la iniciativa con el respaldo de más de un centenar de organizaciones. Entre ellas aparecen empresas como Anthropic, Microsoft, JPMorgan Chase, Perplexity y Accenture.

El consejero delegado de Nvidia, Jensen Huang, defiende que el crecimiento de los agentes autónomos exigirá precisamente este tipo de controles externos a medida que las empresas les permitan trabajar con información y sistemas más sensibles.

En Portada

Vela Zanetti: murales que sobreviven al paso del tiempo en RD

Hay artistas que dejan cuadros. José Vela Zanetti dejó paredes enteras convertidas en memoria.Entre...

9-1-1 recibe un promedio de 382 denuncias por ruido cada día en SD

El Sistema Nacional de Atención a Emergencias y Seguridad 9-1-1 recibió entre el 1...

Viceministro: apagones son por fallas y no de manera deliberada

Las interrupciones en el servicio energético que pueden experimentar en algún momento los usuarios...

Gobierno presenta plan de seguridad ciudadana ante crímenes

El Gobierno presentó anoche su Plan Estratégico de Seguridad Ciudadana en un momento en...

Noticias Relacionadas

De Lanzarote a la Luna: así se prepara el astronauta español Pablo Álvarez para las futuras misiones espaciales

Pablo Álvarez fue seleccionado en noviembre de 2022 por la Agencia Espacial Europea (ESA)...

Skynet ya ha ganado y estamos encantados

Los que ya tenemos una edad hemos crecido con algunos miedos difíciles de explicar...

Starship alcanza la órbita y despliega los satélites Starlink, pero termina explotando en su amerizaje

El decimocuarto vuelo de prueba del cohete Starship de SpaceX comenzó con éxito este...