OpenAI își extinde în 2025 instrumentele Computer Use în ChatGPT și Codex, permițând agenților de inteligență artificială să opereze browsere și alte aplicații pentru a automatiza sarcini digitale, într-un pariu pe eficientizarea muncii online și creșterea utilizării comerciale a platformei.

Una dintre cele mai dificile etape în dezvoltarea agenților de inteligență artificială este formarea unor baze de date suficient de consistente pentru ca aceștia să poată executa sarcini digitale în mod autonom. Modelele trebuie să înțeleagă nu doar textul și imaginile, ci și structura paginilor web, comenzile disponibile și consecințele fiecărei acțiuni.

Datele de antrenament, esențiale pentru agenții digitali

În faza inițială de dezvoltare a modelelor, OpenAI ar fi inclus capturi de ecran analizate cadru cu cadru, astfel încât sistemele să primească din timp informații utile pentru interacțiunea cu interfețele digitale. Ulterior, modelele sunt alimentate cu exemple care arată ce acțiuni trebuie realizate pentru obținerea unui anumit rezultat, de la completarea unui formular fiscal până la construirea unui obiect într-un program de modelare 3D.

Zhou Yu, cercetător în domeniul inteligenței artificiale la Universitatea Columbia și unul dintre specialiștii care au lucrat la un test de referință pentru agenții capabili să opereze computere, explică faptul că acest proces extinde competențele unui model standard și îl pregătește pentru sarcini suplimentare. Potrivit lui Zhou Yu, astfel de seturi de date sunt costisitoare, deoarece presupun colectarea, verificarea și eliminarea erorilor dintr-un volum mare de exemple.

O parte dintre date poate fi furnizată de instructori umani, care demonstrează pas cu pas cum trebuie realizată o anumită operațiune. O altă metodă este învățarea prin consolidare, prin care modelul primește recompense atunci când finalizează corect o sarcină și este încurajat să repete acțiunile care au generat rezultate bune.

„Poate învăța să facă mai multe dintre aceste acțiuni care au fost recompensate”, a declarat Zhou Yu, cercetător în domeniul inteligenței artificiale la Universitatea Columbia, potrivit Business Insider.

Cum interacționează instrumentul cu aplicațiile

Noua generație a tehnologiei nu se bazează exclusiv pe capturi de ecran. În cazul unui site deschis, agentul poate interpreta rapid structura internă a paginii, informațiile de accesibilitate și legăturile dintre elementele disponibile. Capturile de ecran continuă să fie utilizate, iar utilizatorii trebuie să permită înregistrarea ecranului pentru ca sistemul să poată analiza conținutul afișat.

Ari Weinstein, manager în cadrul echipei OpenAI care dezvoltă instrumentele de utilizare a computerului, spune că această combinație de metode îi permite platformei Codex să verifice codul generat, să identifice erori și să îl îmbunătățească într-un proces complet, de la scriere până la testare.

Un exemplu este Cristian Medina Ruiz, programator amator din Cehia, care a folosit Codex pentru a reconstrui jocul de strategie urbană „SimCity”, lansat în 2013, pornind de la codul-sursă original. Instrumentul a deschis o fereastră pe computerul său pentru a verifica dacă jocul simula corect deplasarea automobilelor și afișarea clădirilor.

„Aceste lucruri se întâmplă chiar și atunci când eu nu sunt la computer”, a spus Cristian Medina Ruiz, programator amator.

Ruiz afirmă că experiența l-a determinat să folosească mai intens ChatGPT. În prezent, își lasă codul să ruleze și să fie îmbunătățit automat atunci când nu se află în fața dispozitivului.

Automatizarea proceselor de business

OpenAI urmărește ca agenții să poată lucra cu o gamă largă de site-uri, inclusiv cu platforme care nu au fost proiectate pentru interacțiunea cu software-ul. Printre aplicațiile vizate se numără sistemele de programare a întâlnirilor, platformele interne de gestionare a stocurilor și rețelele sociale.

James Sun, responsabil de dezvoltarea funcțiilor de navigare în cadrul OpenAI, și Ari Weinstein au arătat că utilizatorii testează deja automatizarea introducerii datelor, a proceselor de conformitate și a programării în calendar. Pe măsură ce modelele devin mai performante, acestea ar trebui să poată detecta mai rapid situațiile în care o operațiune nu evoluează corect și să facă ajustări fără intervenție umană.

Totuși, extinderea tehnologiei la orice site, aplicație sau sistem de operare rămâne dificilă. Viteza de execuție este, de asemenea, sub nivelul așteptat de mulți utilizatori. Instrumentul nu poate procesa rapid serii lungi de răspunsuri la e-mailuri și întâmpină întârzieri atunci când navighează prin fluxuri de conținut de pe rețelele sociale.

„Vedem cu siguranță că agenții capabili să utilizeze computerele pot avea rezultate bune în domenii limitate, atunci când le oferim multe date de antrenament. Când vrem să generalizăm pentru orice pagină web, orice aplicație și orice sistem de operare, lucrurile sunt încă foarte dificile”, a declarat Zhou Yu, cercetător în domeniul inteligenței artificiale la Universitatea Columbia.

Ari Weinstein consideră că agenții vor deveni mai eficienți pe măsură ce modelele de inteligență artificială se dezvoltă, însă James Sun anticipează o schimbare mai amplă în modul în care oamenii lucrează cu software-ul.

„Pentru mulți ingineri, în prezent, este pur și simplu mai rapid ca agentul să scrie cod decât să îl scrie ei înșiși”, a spus James Sun, responsabil de funcțiile de navigare din cadrul OpenAI. „Nu există niciun calcul complicat, pur și simplu faci acest lucru. Cred că utilizarea computerului va deveni tot mai asemănătoare.”

Ari Weinstein apreciază că, în momentul în care ChatGPT va putea folosi computere și aplicații mai rapid decât oamenii, interacțiunea cu dispozitivele se va schimba semnificativ.

„Odată ce ChatGPT va putea folosi computerele și software-ul mai rapid decât tine sau decât mine, acest lucru va schimba modul în care vei dori, în mod implicit, să interacționezi cu computerul”, a spus Ari Weinstein, manager în cadrul echipei OpenAI pentru utilizarea computerului.

Anthropic, principalul rival în cursa pentru agenți

OpenAI nu este singura companie care investește în această categorie de produse. Anthropic a lansat prima versiune comercială a funcției sale de utilizare a computerului în 2024 și continuă să își dezvolte soluția. Până în mai, cel puțin 600.000 de organizații testaseră funcția Claude Cowork, care folosește această tehnologie.

OpenAI susține că propriile instrumente au ajuns din urmă oferta rivalului și încearcă să integreze tot mai multe funcții de automatizare în ChatGPT. Miza comercială este creșterea frecvenței de utilizare a platformei și transferarea către agenți a unui număr tot mai mare de sarcini administrative și operaționale.

Riscurile pentru date și securitate

Extinderea accesului la browsere și aplicații ridică însă probleme legate de confidențialitate, securitate cibernetică și guvernanța utilizării inteligenței artificiale. Sam Altman, directorul general al OpenAI, a avertizat că avantajele instrumentului sunt însoțite de riscuri importante.

„Deși utilitatea este semnificativă, la fel sunt și riscurile potențiale”, a scris Sam Altman, directorul general al OpenAI.

„Recomandăm să le acordați agenților accesul minim necesar pentru a finaliza o sarcină, pentru a reduce riscurile privind confidențialitatea și securitatea”, a adăugat Sam Altman.

Mark Beare, director general în cadrul companiei de securitate Malwarebytes, consideră că responsabilitatea transferată utilizatorilor poate genera vulnerabilități. Companiile nu dispun întotdeauna de politici suficient de mature pentru protejarea informațiilor și pentru controlul instrumentelor de inteligență artificială.

„Totul mi se pare încă puțin asemănător Vestului Sălbatic”, a declarat Mark Beare, director general în cadrul Malwarebytes.

El recomandă ca persoanele care testează funcția să izoleze parolele, datele sensibile și documentele acoperite de acorduri de confidențialitate sau de legislația privind protecția vieții private. Beare avertizează și asupra riscului ca un site rău intenționat să manipuleze agentul și să încerce să obțină informații personale.

Controlul acțiunilor realizate de agent

OpenAI lucrează la o politică de confirmare, care stabilește când trebuie ca instrumentul să solicite aprobarea utilizatorului înainte de a continua. James Sun spune că, până în prezent, compania a decis ca agentul să ceară acordul de fiecare dată când urmează să transmită date sau să șteargă informații.

Problema este găsirea unui echilibru între securitate și ușurința de utilizare. Un sistem care solicită confirmări la fiecare etapă poate deveni greoi, în timp ce un agent cu libertate extinsă de acțiune poate produce pagube sau poate divulga date în cazul unei erori.

„Poți face un sistem 100% sigur, dar atunci devine foarte, foarte dificil de folosit, sau poți face un sistem foarte ușor de utilizat, dar foarte periculos. Așa că încercăm să găsim modalitatea de a construi ceva util și, în același timp, ușor de folosit”, a declarat James Sun, responsabil de funcțiile de navigare din cadrul OpenAI.

Ți-a plăcut articolul?

Vrem să producem mai multe, însă avem nevoie de susținerea ta. Orice donație contează pentru jurnalismul independent