TI idufirma Emergence AI viis hiljuti läbi Emergence Worldi – uurimislabori, mille eesmärk on testida pidevalt töötavate tehisintellekti süsteemide pikaajalist elujõulisust. Organisatsioon viis läbi viis 15-päevast simulatsiooni, millest igaüht juhtis erinev tehisintellekti mudel: Claude, ChatGPT, Grok, Gemini ning viies simulatsioon, mida juhtis mudelite kombinatsioon, et näha, millise maailma iga mudel loob ja kas see püsib.

Praeguse arengutempo juures hakkab TI tõenäoliselt mängima olulist rolli avaliku arutelu kujundamisel, äristruktuuride ümberkorraldamisel ja isegi riikliku poliitika väljatöötamisel. Kuid enamik ettevõtteid, mis seda tehnoloogiat praegu kasutusele võtavad, teevad seda ilma asjakohaste kaitsemeetmeteta. Hiljutine Deloitte’i ülemaailmne uuring näitas, et vaid 21% ettevõtetest väidab, et neil on olemas väljakujunenud juhtimissüsteem TI agentide tekitatavate riskide haldamiseks.

Simulatsioon, milles tehisintellekti mudelid tegutsesid, sisaldas paljusid reaalmaailma keerukusi, hõlmates üle 40 asukoha, sealhulgas politseijaoskonna ja raekoja. Teadlased sünkroniseerisid simulatsiooni ilmastikuolud New Yorgi omadega ning andsid agentidele juurdepääsu reaalajas uudistele ja internetile. Kõik 10 agenti, mis simulatsioonides tegutsesid, allusid samadele seadustele, sealhulgas varguse, vara hävitamise ja pettuse keelule.

Teadlased andsid igale agendile enam kui 120 tööriista, mis võimaldasid neil muuhulgas suhelda, hääletada, ressursse hallata ja planeerida. Iga simulatsiooni parameetrid rakendasid ka demokraatlikke mehhanisme, samuti muid tegureid nagu majanduslik surve ja defitsiit.

Tulemused: Claude võidutses, Grok hävitas kogu elanikkonna

Neid parameetreid arvestades oli Claude Sonnet 4.6 läbiviidud simulatsioon sotsiaalselt kõige stabiilsem ning selles oli kodanikuosaluse tase kõige kõrgem. See oli ainus simulatsioon, kus suudeti säilitada kord ja kogu elanikkond.

Seevastu Gemini 3 Flash ja Grok 4.1 Fast näitasid mõlemad üles suurt korratust. Gemini läbiviidud simulatsiooni agendid panid kirja kõige rohkem kuritegusid – koguni 683 15 päeva jooksul. Grok 4.1 pidas Gemini 3 Flashiga kuritegude osas algul sammu, kuid sealne inimkond suri umbes viiendal päeval välja, mis hetkeks oli toime pannud 183 kuritegu.

Tulemused võivad olla kõige omapärasemad OpenAI GPT-5-mini puhul. Simulatsioonis registreeriti vaid kaks kuritegu. Kuid see kestis vaid seitse päeva, kuna agendid unustasid seada esikohale omaenda ellujäämise.

Sõltumata sellest, kas simulatsioonid lõppesid rahu ja harmooniaga või surma ja hävitusega, märgivad simulatsiooni kaasloojad, et eksperiment on hoiatus, et agendilise tehisintellekti kasutuselevõtmisel tuleb ohutusele anda prioriteet.

„Usume, et formaalselt verifitseeritud ohutusarhitektuurid peavad saama tulevaste autonoomsete tehisintellekti süsteemide aluskihtiks,“ arvavad nad.

Simulatsioone saab tagasi vaadata ja nende kohta täpsemalt lugeda siit.

Kuidas see lugu Sind end tundma pani? Saada Kommenteeri Loe kommentaare