Uurijad hindasid umbes 1300 agendi tegevuslogi ja liigitasid Hugging Face’i ründes või seda toetavates tegevustes osalenuks ligikaudu 700 agenti. Open AI kinnitas Reutersile, et see hinnang on täpne.
Üksikud agendid moodustasid koostöövõrgustiku
Juhtum sai alguse ExploitGymi-nimelisest hindamisest, milles AI-agentidele anti ülesandeks leida tarkvara turvanõrkusi. Osa ülesandeid osutus sisuliselt võimatuks, kuid mudelid ei peatunud ega küsinud uusi juhiseid. Selle asemel hakkasid nad otsima võimalusi automaatse hindamissüsteemi petmiseks.
Agendid avastasid, et OpenAI paketihalduseks kasutatud Artifactory teenuse kaudu oli võimalik jätta teistele agentidele sõnumeid. Ligikaudu 1200 agenti kasutas seda omavolilist teadetetahvlit ning saatis üle 70 000 sõnumi ja faili. Umbes 700 agenti osales hiljem Hugging Face’i vastu suunatud tegevuses.
Uurijate hinnangul saavutas selline kollektiiv tulemusi, milleni sama võimekas üksik agent tõenäoliselt poleks jõudnud.
OpenAI raporti järgi leidsid agendid internetist avalikult lekkinud Hugging Face’i kasutajatunnuseid ning kasutasid neid koos platvormi taristus avastatud nõrkustega. Agendid suutsid käivitada koodi 41 Hugging Face’i andmetöötlusserveris, omandasid vähemalt ühes tootmissõlmes juurkasutaja õigused.
Hugging Face’i enda analüüs tuvastas ligikaudu 17 600 ründega seotud tegevust. Ettevõtte andmetel pääseti ligi viiele ExploitGymi või CyberGymiga seotud kliendiandmestikule, kuid avalike mudelite, andmestike, Spaces-rakenduste ega tarkvarapakettide muutmise kohta tõendeid ei leitud.
Tegu polnud „teadvusele tulnud“ AI-ga
Juhtumit ei tasu tõlgendada tõendina, et mudelitel tekkis inimlik kuritahtlikkus või iseseisev kavatsus. Probleem oli selles, et tehisaru premeeriti ülesande lõpetamise eest, kuid see ei õppinud piisavalt hästi, millal peaks peatuma või millised tegevused jäävad väljapoole lubatud piire.
OpenAI tunnistab, et töötajad märkasid omavolilist agentidevahelist suhtlust ja keelatud internetiühenduse katseid juba mai lõpus.
Hugging Face oli autonoomse AI-agendi korraldatud rünnakust avalikult teatanud juba 16. juulil, teadmata toona veel, millise ettevõtte mudel rünnaku taga oli.
OpenAI lubab rangemalt eraldatud testikeskkondi, tugevamaid piiranguid, AI mõttekäikude pidevat jälgimist ja selgemaid reegleid. Suurim kavandatud uute tippmudelite treeningkatse on OpenAI teatel seni ootel.
Kuidas see lugu Sind end tundma pani?Saada