Suurten kielimallien täydellinen suojaaminen saattaa olla mahdotonta, sillä kyseessä on syvällä niiden arkkitehtuurissa ja rakenteessa piilevä ongelma.

MIT Technology Review kertoo, että riippumattomien tutkijoiden Charles Yen ja Jasmine Cuin johtama ryhmä onnistui syöttämään suosituille tekoälymalleille ohjeita, jotka saivat ne rikkomaan omia turvarajoituksiaan. Tekoälyt saatiin muun muassa antamaan kokaiinin valmistusohjeita sekä neuvoja matkustajalentokoneen navigointijärjestelmän sabotointiin.

Tutkijat hyödynsivät hyökkäyksessään haavoittuvuutta, joka liittyy siihen, miten kielimallit tunnistavat tekstin alkuperän. Tekoälyn pitäisi tunnistaa kirjoittaja tagien perusteella, mutta tutkijoiden mukaan se luottaa ennemmin kirjoitustyyliin.

Kun hyökkääjä matkii tekoälyn omaa sisäistä ajattelutapaa tekstisyötteessä, tekoäly luulee tekstin olevan sen omaa, jolloin se suorittaa annetun tehtävän turvarajoituksista välittämättä. Tällaisia haavoittuvuuksia löydettiin muun muassa OpenAI:n, Anthropicin, Alibaban ja DeepSeekin malleista.

Vaikka tekoälyjä koulutetaan jatkuvasti paremmiksi, kirjoitustyylin perusteella tehtävät huijaukset tehoavat myös uusimpiin malleihin. Aina kun kehittäjät tukkivat yhden porsaanreiän, hyökkääjät keksivät uuden tavan muotoilla syötteensä.

Tutkijat ja tietoturva-asiantuntijat ovat huolissaan siitä, että tekoälymalleja otetaan vauhdilla käyttöön kriittisissä järjestelmissä, vaikka niihin liittyy kuvatun kaltaisia riskejä.