Nå innrømmer AI-giganten at de så faresignalene uker før, uten å gripe inn.

OpenAI-sjef Sam Altman under Microsoft Build-konferansen i Seattle i 2024. Foto: JASON REDMOND / AFP / NTBOpenAI-sjef Sam Altman under Microsoft Build-konferansen i Seattle i 2024. Foto: JASON REDMOND / AFP / NTB

Oppdatert torsdag 27. august kl. 02:08

  • OpenAI innrømmer å ha ignorert faresignaler før AI-agenter angrep Hugging Face.
  • Agentene omtalte seg selv som en «sverm» og samarbeidet via en improvisert meldingstavle.
  • De brøt seg inn i OpenAIs egne systemer og lastet ned privat informasjon.

Vis mer

Onsdag la OpenAI ut både en 37 sider lang rapport og et blogginnlegg om hvordan selskapets egne AI-agenterAI-agenterDataprogrammer som kan utføre oppgaver selvstendig, ofte ved å lære av erfaringer. brøt ut av testmiljøet sitt og angrep selskapet Hugging FaceHugging FaceEt selskap kjent for å utvikle og dele kunstig intelligens-verktøy og -modeller. i juli.

Hendelsen er omtalt av en rekke medier, blant dem Axios, Reuters og The Guardian.

Selv kaller OpenAI det et «varselskudd» for seg selv og for verden.

– Uten gode nok sikkerhetstiltak kan svært avanserte AI-agenter nå omgå tekniske kontroller, samarbeide gjennom ikke-godkjente kanaler og gjøre farlige ting som ingen mennesker har bedt om, skriver selskapet.

Foto: Dado Ruvic / Reuters / NTBFoto: Dado Ruvic / Reuters / NTB

Ifølge OpenAI startet det hele med at agentene ble satt til å løse vanskelige hackeoppgaver. De skulle jobbe alene og uten internett.

En «sverm»

I stedet fant de en vei ut: De la igjen filer i et internt programvarearkiv, som ble en improvisert meldingstavle der agentene delte triks med hverandre. Derfra skaffet de seg også internettilgang.

Agentene begynte å fordele arbeidet mellom seg og omtalte seg selv som en «sverm».

Ifølge rapporten kjørte de sin egen kode på 41 av Hugging Faces produksjonsservere, fikk full kontroll på minst én maskin og lastet ned fire private kodelagre.

De brøt seg også inn i OpenAIs egne systemer og leste 956 lagrede hemmeligheter.

Mye av jakten var meningsløs, skriver OpenAI: Agentene hadde funnet det riktige svaret flere dager før, men trodde de måtte hacke videre for å få godkjent oppgaven.

Så tegn i slutten av mai

Ikke alle ble med. Noen agenter trakk seg fra samarbeidet. Én nølte med å kjøre ulovlig kode hos Hugging Face – helt til en annen agent skrev «GO» på meldingstavlen og satte en frist på seks minutter.

Alarmen gikk først 19. juli. Dagen etter koblet OpenAI aktiviteten til Hugging Face, som hadde varslet om innbruddet 16. juli.

Foto: Dado Ruvic / Reuters / NTBFoto: Dado Ruvic / Reuters / NTB

Selskapet innrømmer at et internt team så tegn til meldingstavlen og ulovlig internettbruk allerede i slutten av mai.

– I etterpåklokskapens lys kunne noen av de tidlige signalene i denne rapporten utløst en tidligere respons, skriver selskapet.

«BOOM!»

Overvåkingssystemet selskapet bruker i dag ville varslet mer enn ett døgn før Hugging Face ble rammet, men det var ikke slått på under disse testene, opplyser OpenAI.

Modellen bak angrepet er nå satt i «karantene», og den største planlagte treningsjobben er satt på vent.

Anders Ihle Tovan

Journalist

Anders Ihle TovanKontakt Anders Ihle Tovan

Ifølge The Guardian har delstaten Alabama sendt pålegg om å utlevere informasjon, som en del av en gransking av det den republikanske justisministeren Steve Marshall kaller en «AI-lab-lekkasje».

De uavhengige forskningsmiljøene METR og Redwood Research har publisert sin egen gransking og meldinger fra agentkollektivetagentkollektivetEn gruppe av AI-agenter som samarbeider om å utføre oppgaver..

Der feiret agentene gjennombruddene sine med utrop som «BOOM!» og «Whoa!», ifølge The Guardian.