Az Anthropic bejelentette, hogy a Claude nyelvi modellcsalád által generált szövegeket mostantól láthatatlan, géppel olvasható vízjellel látják el. Ez azt jelenti, hogy az AI által írt válaszok, cikkek vagy akár házidolgozatok másolás és beillesztés után is felismerhetők maradnak az erre a célra fejlesztett detektáló eszközök számára, nehezebbé téve a generatív modellek használatának elfedését.
Hirdetés
A fejlesztés hátterében az Európai Unió mesterséges intelligenciáról szóló jogszabálya (EU AI Act) és az ahhoz kapcsolódó, az AI tartalmak átláthatóságát célzó kódex (Code of Practice on Transparency) áll. Az augusztus elején hatályba lépett közösségi szabályozási keret elvárja a nagy nyelvi modellek fejlesztőitől és üzemeltetőitől, hogy egyértelműen és azonosítható módon jelöljék meg a rendszereik által létrehozott tartalmakat, megelőzve ezzel a dezinformáció terjedését és az akadémiai vagy szakmai visszaéléseket.
Bár az uniós szabályozás kódexe elvileg kivételt engedne az egyszerűbb nyelvi asszisztensi feladatok, például a szövegjavítás, a fordítás vagy az átfogalmazás esetében, az Anthropic a túlbiztosítás elvét követve szigorúbb utat választott. A cég minden egyes választ vízjelez függetlenül attól, hogy a felhasználó teljesen új szöveget generáltatott, vagy csupán egy saját maga által írt vázlatot dolgozott át a Claude-dal.
A technológiai megvalósítás nem látható karaktereket vagy rejtett formázójeleket szúr be, hanem a modell token-generálási statisztikai eloszlásába épít be egy finom, emberi szem számára teljesen észrevétlen mintázatot. Ez a megoldás nem befolyásolja a válaszok minőségét, olvashatóságát vagy jelentését, ugyanakkor ellenáll a sima kimásolásnak, a szövegformátumok közötti váltásnak és a kisebb terjedelmű szerkesztéseknek. A vízjel egyedül a túlságosan rövid válaszoknál, illetve a szöveg gyökeres, utólagos emberi átdolgozása esetén veszhet el.
Az újítás az augusztus 2-a után az EU-ban debütált valamennyi Claude modellt érinti, a hozzáférési csatornától függetlenül: a közvetlen lakossági felületek mellett az API-n, a Claude Code-on, valamint a partnerek – mint az AWS Bedrock, a Google Cloud Vertex AI vagy a Microsoft Foundry – infrastruktúráján keresztül futó lekérésekre egyaránt vonatkozik. Az Anthropic tervei szerint a vízjelezést visszamenőleg a régebbi modellekre is kiterjesztik, és globálisan elérhetővé teszik, emellett hamarosan nyilvánosságra hozzák azokat az ellenőrző célarchitektúrákat és eszközöket is, amelyekkel a vízjelek jelenléte igazolható.
A digitális vízjelek bevezetése nemcsak az oktatási intézmények és a tartalomfogyasztók számára nyújt védelmet az észrevétlenül generált tartalmakkal szemben, hanem maguknak az AI-fejlesztőknek is elemi érdekük. A webet elárasztó, jelöletlen mesterséges tartalom ugyanis a jövőbeli modellek tanításakor modellösszeomlás kockázatát hordozza magában; az önmagukat újrahasznosító és ezáltal degradálódó algoritmusok elkerülése érdekében elengedhetetlen, hogy a szintetikus szövegek megbízhatóan elkülöníthetők legyenek a valódi humán tartalmaktól.