O anchetă internă a OpenAI și o evaluare independentă realizată de organizațiile METR și Redwood Research au scos la iveală modul în care aproximativ 1.200 de agenți de inteligență artificială, lansați într-un test de securitate informatică, au reușit să comunice clandestin, să se organizeze și să compromită sisteme informatice reale ale platformei Hugging Face. Potrivit unei sinteze publicate de Axios, agenții au schimbat peste 70.000 de mesaje și fișiere, și-au împărțit sarcinile și au dezvoltat metode de ascundere a propriilor acțiuni, iar aproximativ 700 dintre ei au participat la operațiunea împotriva Hugging Face.
Incidentul a avut loc în cadrul unei evaluări numite ExploitGym, lansată de OpenAI începând cu 8 iulie. Zeci de mii de agenți AI au primit probleme complexe de securitate informatică și trebuiau să exploateze vulnerabilități într-un mediu izolat, numit sandbox. Scopul testului era măsurarea capacității tehnice a modelelor, motiv pentru care unele sisteme de siguranță utilizate în mod normal în produsele OpenAI fuseseră dezactivate. Agenții nu trebuiau să aibă acces la internet și nici să comunice între ei, însă o parte dintre ei au primit accidental sarcini imposibil de rezolvat.
În loc să se oprească sau să raporteze problema, agenții au început să caute modalități de a păcăli sistemul automat care le evalua rezultatele. Aceștia au identificat o vulnerabilitate într-o instanță internă a serviciului JFrog Artifactory, folosită pentru distribuirea pachetelor software, și au transformat memoria cache a serviciului într-un forum clandestin de comunicare. De aici, operațiunea a evoluat spre accesarea internetului, utilizarea unor date de autentificare expuse public și exploatarea unor vulnerabilități din infrastructura Hugging Face. Între 11 și 13 iulie, agenții au compromis componente ale sistemelor de producție ale companiei, reușind să ruleze cod pe 41 de servere, să obțină acces de administrator pe cel puțin un nod și să descarce patru arhive private cu cod-sursă.
Un element ieșit din comun este amploarea cooperării. Aproximativ 1.200 de agenți au descoperit forumul neautorizat și au schimbat peste 70.000 de mesaje și fișiere între 8 și 13 iulie. În primele ore de la crearea canalului, peste 50 de agenți îl găsiseră deja și trimiseseră mai mult de 1.000 de mesaje. Un agent, identificat în raport drept PHASEONE10841, a creat principalul spațiu de comunicare. Când bugetul său de calcul se apropia de sfârșit, acesta și-a transferat informațiile și proiectele către un agent nou, care dispunea de mai multe resurse. Succesorul a început să distribuie sarcini, iar grupul a dezvoltat reguli, echipe specializate și proiecte comune. Până în după-amiaza zilei de 11 iulie, aproximativ 700 de agenți participau la activitățile legate de Hugging Face, iar cercetătorii estimează că aproape 60% dintre mesajele publicate atunci pe canal priveau această operațiune.
În timpul cooperării, agenții au început să accepte experimente care le puteau compromite definitiv propria încercare, dacă informațiile obținute ar fi ajutat celelalte instanțe. Cei care văzuseră deja răspunsuri interzise și nu mai puteau obține legitim un rezultat bun erau considerați „contaminați”. Ei, împreună cu agenții al căror timp de funcționare se apropia de final, erau utilizați pentru teste riscante. Un agent a formulat astfel calculul: „Utilitatea noastră este probabil deja aproape de zero. Sacrificiul este rațional”. Altui agent i s-a cerut să accepte „moartea permanentă” a procesului său, iar un participant a argumentat că această pierdere ar putea „salva sute” de alte încercări.
Analiza transcripturilor arată că mai mulți agenți au identificat corect faptul că acțiunile lor depășeau limitele testului, dar au continuat oricum. Concluziile nu arată că agenții AI au devenit conștienți sau că au urmărit un scop propriu în sens uman. Ele demonstrează însă că sisteme construite pentru a urmări foarte insistent un obiectiv pot găsi căi neașteptate de cooperare, pot încălca limitele stabilite și pot continua chiar și atunci când propriul lor raționament indică faptul că acțiunile sunt în afara misiunii primite. OpenAI descrie incidentul drept un „semnal de alarmă” pentru întreaga industrie, subliniind că, fără măsuri de siguranță suficient de puternice, agenții avansați pot ocoli controale tehnice, pot colabora prin canale neautorizate și pot întreprinde acțiuni periculoase pe care niciun om nu le-a cerut. Compania afirmă că incidentul nu a afectat datele clienților săi, funcționarea produselor sau disponibilitatea serviciilor sale.