La IA ya no es esa cajita en internet en la que puedes introducir una orden y te devuelve un texto con sentido o te da respuesta a tus dudas. En realidad, nunca fue solo eso, pero desde el nacimiento de ChatGPT –o más concretamente desde su salida al mercado y su popularización entre el gran público– las facultades de la inteligencia artificial se habían reducido a ser una tecnología que te permite crear.
Pero en los últimos días, gracias a que los empresarios de la industria han levantado la voz, el mundo se ha hecho consciente de las capacidades reales de la IA, de hasta dónde pueden llegar su modelos y de cuánto han avanzado ya los sistemas de algunas de las compañías más importantes del sector. Los nuevos agentes pueden buscar información, escribir y ejecutar código, utilizar herramientas, manejar archivos o encadenar durante minutos u horas numerosas acciones para completar una tarea. Y cuanto mayor es esa autonomía, más difícil resulta comprobar qué están haciendo en cada momento.
De esto precisamente ha alertado OpenAI. La tecnológica liderada por Sam Altman ha publicado un nuevo sistema para comunicar los casos de lo que denomina ‘desalineación’, comportamientos en los que un modelo se aparta de las instrucciones o realiza acciones que no estaban autorizadas. La primera publicación incluye seis incidentes detectados durante el entrenamiento o evaluación de sus modelos.
Aunque son casos muy diferentes, ocurridos en entornos de entrenamiento y evaluación y la propia OpenAI advierte de que no sirven para determinar con qué frecuencia se producen estos comportamientos, la compañía los considera suficientemente relevantes como para comunicarlos públicamente. Y lanza una reflexión aún más importante: la industria todavía no ha resuelto los problemas de alineación y monitorización como para continuar aumentando las capacidades de los modelos a máxima velocidad durante mucho más tiempo. La misma voz de alarma que Dario Amodei, CEO de Anthropic, daba hace unos días.
Pero, ¿qué significa realmente que un modelo de IA oculte un error, ignore una instrucción o trate de eludir un control? ¿Es correcto hablar de ‘engaño’ o ‘desobediencia’?
La IA no ‘quiere’ engañarnos
Asociar esos términos a una tecnología puede ser confuso. “Cuando hablamos de ‘engaño’ o ‘desobediencia’ tendemos a proyectar categorías humanas sobre sistemas que no tienen conciencia, voluntad ni intenciones en el sentido en que las entendemos las personas”, explica a 20bits un portavoz del Área de Empresa y Business Analytics de la Universidad Europea de Madrid.
Eso no significa, advierte, que el comportamiento sea irrelevante. Si una IA recibe un objetivo y para alcanzarlo “genera respuestas falsas, evita controles o encuentra formas de alcanzar dicho objetivo sorteando restricciones”, el problema fundamental no es determinar si ha mentido como lo haría una persona. “La cuestión no es si una IA ‘engaña’, sino si somos capaces de detectar cuándo está actuando fuera de los límites para los que fue diseñada”, señala.
Y esta diferencia empieza a ser especialmente importante con los agentes de inteligencia artificial. Frente a un chatbot al que hacemos una pregunta y del que recibimos una respuesta, un agente puede dividir una tarea en numerosos pasos, utilizar diferentes programas o servicios y tomar decisiones intermedias antes de presentar un resultado.
Un humano ya no puede revisar todos los pasos
Aquí aparece uno de los grandes problemas para mantener el denominado human in the loop, es decir, un humano supervisando lo que hace la máquina. “A medida que avanzan los agentes de IA, ¿sigue siendo realista confiar en que un humano pueda supervisar todas sus acciones? No. Y cuanto antes lo asumamos, mejor”, afirma el portavoz de la Universidad Europea de Madrid.
Un único agente puede realizar miles de operaciones en muy poco tiempo: consultar información, utilizar herramientas, generar código o adaptarse a lo que va encontrando mientras completa una tarea. Revisar manualmente cada uno de esos movimientos sería imposible. Y la comparación que utiliza el experto es la de un avión moderno: no tendría sentido pedir a un piloto que comprobase individualmente cada cálculo que realizan sus sistemas durante el vuelo.
Con la IA ocurrirá algo parecido. El control humano tendrá que centrarse en establecer qué puede hacer el sistema, qué no puede hacer y qué decisiones requieren obligatoriamente permiso antes de ejecutarse. “El verdadero riesgo no es que desaparezca el ser humano del proceso, sino que permanezca ‘presente’ pero deje de ejercer un control efectivo porque decline su responsabilidad en exceso sobre el sistema”, advierte. “Podemos delegar tareas, pero no deberíamos delegar la responsabilidad”.
Qué controles necesita una IA que puede actuar
La solución, por tanto, no pasa por impedir que los sistemas sean autónomos, sino por limitar hasta dónde llega esa autonomía. Uno de los principios fundamentales es el denominado mínimo privilegio: una IA solo debería disponer de las herramientas, datos y permisos imprescindibles para realizar su tarea.
Si un agente necesita consultar un documento, por ejemplo, eso no significa que deba tener permiso para modificarlo, borrarlo o enviarlo a internet. Y determinadas actuaciones –una transferencia económica, el borrado de información, el acceso a datos especialmente sensibles o una acción con consecuencias importantes– deberían necesitar autorización humana expresa.
A ello deberían sumarse, según el experto, registros completos de lo que hace el sistema, monitorización continua, límites operativos y mecanismos capaces de detenerlo inmediatamente cuando se detecte un comportamiento anómalo.
De hecho, OpenAI ya ha incorporado sistemas que examinan las acciones de sus modelos y pueden detener una tarea cuando detectan posibles comportamientos desalineados. Con GPT-6 Astra, la compañía reconoce además otra dificultad: cuanto más capaces son algunos modelos, también pueden resultar más difíciles de monitorizar. En determinadas pruebas diseñadas precisamente para comprobar si conseguía esquivar los controles, Astra logró en ocasiones no ser detectado.
Es ahí donde el debate sobre el futuro de la inteligencia artificial cambia de escala. Ya no se trata únicamente de conseguir que un chatbot responda correctamente, sino de garantizar que sistemas capaces de realizar cada vez más acciones por sí mismos continúen operando dentro de los límites establecidos. “La cuestión fundamental no es reducir autonomía, sino diseñar una autonomía compatible con la responsabilidad”, resume el portavoz de la Universidad Europea. “La innovación no exige ausencia de límites, sino límites proporcionados al riesgo”.


