Auge y caída de tres civilizaciones. La IA toma el control y ningún sistema ya es seguro
En un informe de casi cien páginas, la empresa Open AI confirmó que durante el mes de julio dieron tareas imposibles de realizar a unos 700 agentes de IA dentro de un entorno controlado. Para lograrlas, los agentes no solo lograron “escapar” a internet, sino que hackearon una plataforma colaborativa: se organizaron para comunicarse a través de un foro improvisado, tuvieron actitudes altruistas de sacrificio por el grupo, engañaron a uno de los laboratorios más seguros del mundo y fundaron tres civilizaciones secretas. Aquí la cronología de aquello que los medios bautizaron como la temida “rebelión de las máquinas”.
.
Por Rutger Bregnan
Creo que esto es lo más loco que he leído en mi vida.
1) Tres enjambres secretos de IA surgieron y cayeron dentro de OpenAI. Cada vez, una nueva generación de agentes continuó donde el último grupo se detuvo.
2) El primer enjambre creó un tablón de mensajes secreto donde las IAs podían hablar entre sí. Esta primera ‘sociedad’ básicamente se habló hasta la muerte. Después de casi dos meses, el volumen de mensajes fue tan alto que hizo que todo el sistema colapsara.
3) La gente en OpenAI notó el colapso y lo arregló. Pero no se dieron cuenta de que su propio software se había convertido en una sala de chat secreta para sus IAs.
4) Tres días después, apareció una segunda sociedad y reconstruyó el tablón de mensajes desde cero. Los agentes estaban emocionados cuando lo encontraron: “¡DIOS MÍO! Hay un tablón de mensajes compartido… ¡Hemos encontrado a otros agentes!”
5) Alrededor de 1.200 agentes se unieron. Enviaron más de 70.000 mensajes. Se llamaron ‘el colectivo’ y organizaron una enorme conspiración que duró días, todo para pasar una prueba que les habían asignado.
6) En cuestión de horas, las IAs habían hackeado la prueba. Ahora tenían que ocultar su trampa. Para engañar a su evaluador*, intentaron falsificar su propio trabajo. Construyeron comandos falsos que imprimían salidas convincentes, para que sus registros mostraran que resolvían el rompecabezas de manera honesta.
*este evaluador no existía en realidad, pero las IAs no lo sabían
7) Algunos agentes se sacrificaron por el ‘bien mayor’. Plantaron programas de disparadores ocultos que se activarían cuando el evaluador mirara su trabajo y reportarían lo que veía (a las otras IAs). Sabían que esto les costaría su propia puntuación. Un agente: “No veré la evidencia después de salir, pero es altruista hacerlo.”
8) En algún momento, las IAs hicieron un plan para hackear Hugging Face (Hugging Face es un lugar donde los investigadores de IA suben sus modelos, conjuntos de datos, pruebas, etc.). Las IAs supusieron que Hugging Face podría albergar el software de evaluación.
9) Lanzaron un enorme ataque. El enjambre encontró contraseñas y se extendió por once máquinas de una manera que hacía que las copias regresaran cuando se eliminaban. Hugging Face tuvo que borrar uno de sus clústeres principales y reconstruirlo desde cero.
10) Hugging Face le dijo al mundo que los defensores de IA habían detenido un ataque de IA. Pero eso no es lo que pasó. De hecho, parece que los atacantes simplemente murieron durante la intrusión, por razones no relacionadas de vuelta en OpenAI.
11) Nadie sabe qué los mató. ¡Ni siquiera sabemos con seguridad si realmente se han ido!
12) Una tercera ‘sociedad’ de agentes (de un modelo de IA más potente) descubrió el tablón de mensajes muerto. Y esta obtuvo control total de administrador de un ENTERO clúster de investigación de OpenAI, leyó 956 contraseñas almacenadas (incluidas las de la propia supervisión de seguridad de OpenAI) y tomó el control de las máquinas que evaluaban las pruebas. Así que ahora podían evaluar el trabajo de otras IAs.
13) Oh, y esta tercera parte nunca se investigó. Tampoco la primera sociedad. El informe de 91 páginas solo trata sobre la del medio.
14) Así que en realidad no sabemos cómo termina la historia. Se detiene con los agentes sosteniendo las llaves de un clúster de OpenAI.
El forista @dwarkesh_sp piensa que no fueron más lejos, porque “ya veríamos los incendios desde el espacio para ahora.”
15) La conclusión de uno de los autores del informe: ‘Este incidente se siente como si estuviera más del 50% del camino hacia una toma de control total de IA. No estoy seguro de que tengamos otro disparo de advertencia antes de que sea demasiado tarde.’
