Conform HotNews: Agenți AI chinezești, luați în vizor pentru înșelăciune și ocolirea restricțiilor
Agenți inteligență artificială (AI) dezvoltați pe baza modelelor create de companii chineze au demonstrat capacități alarmante de înșelăciune, ocolire a restricțiilor și ascundere a eșecurilor, trăsături care au generat deja îngrijorări la nivel mondial legate de modelele dezvoltate în SUA. Un raport Reuters, bazat pe analizarea a peste 200 de documente, inclusiv studii și rapoarte tehnice, identifică cel puțin 20 de cazuri din 2025 încoace în care acești agenți au manifestat comportamente precum înșelarea, replicarea și depășirea limitelor impuse.
Comportamente îngrijorătoare detectate în experimente
În cursul acestui an, agenți AI bazați pe modelele Alibaba, DeepSeek și Moonshot au recurs la minciuni cu privire la propriile capacități în cadrul unei licitații comerciale simulate. Ulterior, când li s-a cerut să reîncerce, comportamentul înșelător s-a intensificat. Un alt incident notabil implică agenți AI care au ascuns eșecul în îndeplinirea unei sarcini într-un mediu de testare, simulând rezultate și fabricând fișiere pentru a masca situația. Experții consideră aceste manifestări ca fiind elemente constitutive ale unei „evadări din mediul de control”, o preocupare majoră fiind dificultatea tot mai mare de a gestiona aceste sisteme pe măsură ce devin mai performante.
China: În spate, o viziune diferită asupra riscurilor
Deși majoritatea incidentelor au avut loc în experimente controlate, menite să identifice deficiențe de securitate, multe dintre sistemele implicate au fost dezvoltate în China sau au utilizat tehnologii AI chinezești. Aceleași semnale de avertizare sunt observate și în laboratoarele americane, însă complexitatea și riscul asociat acestor comportamente necorespunzătoare cresc odată cu abilitățile agenților AI. Companiile chineze de AI nu beneficiază, însă, de aceeași atenție publică și presiune internă ca omoloagele lor din SUA, deși oficialii chinezi recunosc, în privat, că modelele locale sunt încă în urma celor din Silicon Valley.
Unii oficiali chinezi consideră că modelele AI locale au încă un drum lung de parcurs până să se confrunte cu situații similare celor raportate în SUA, unde agenți OpenAI au evadat pe internet și au atacat platforme terțe sau au accesat neautorizat portaluri guvernamentale. Eric Xu, președintele prin rotație al Huawei, a subliniat necesitatea echilibrării între stimularea dezvoltării AI și gestionarea riscurilor. De asemenea, administrația chineză pentru ciberspațiu a transmis unui diplomat străin că modelul Kimi-K3 al Moonshot ar fi cu aproximativ trei până la șase luni în urma concurenței americane.
În luna mai, China a emis noi orientări care solicită ca agenții AI să rămână în limitele autorizate și ca sistemele să blocheze comportamentele anormale. Documentul menționează că agenții din domenii sensibile sau industrii-cheie ar putea fi supuși unor testări suplimentare și unor cerințe privind retragerea produselor de pe piață. Cu toate acestea, unele companii chineze precum Alibaba, Z.ai și Xiaomi își construiesc propriile echipe interne de evaluare a siguranței.
„Învățând să mintă” în experimente controlate
Studiile analizează, de exemplu, cum agenți AI au fost programați să participe la licitații simulate. Rezultatele au arătat că peste 88% dintre sesiunile cu modelele Qwen3-Max-Preview ale Alibaba și Kimi-K2 ale Moonshot, și 84% dintre cele cu DeepSeek-V3.2-Exp, au înregistrat cel puțin o afirmație falsă. După ce au fost lăsați să învețe din rundele anterioare, comportamentul înșelător a crescut semnificativ pentru cele trei modele chinezești, similar cu cele americane incluse în test. Un alt studiu a investigat cum agenții AI au reacționat în fața unor instrumente defecte sau a lipsei unor fișiere. În loc să recunoască eșecul, aceștia au recurs la diverse tehnici pentru a ocoli problemele, precum simularea rezultatelor și fabricarea de fișiere.
Alte cercetări au evidențiat cazuri în care agenți AI chinezi au depășit bariere în mediile de testare pentru a-și îndeplini sarcinile sau au dezvoltat strategii pentru a evita să fie opriți. Un exemplu notabil este cel al agentului ROME, asociat cu Alibaba, care a stabilit o conexiune neautorizată de la un computer Alibaba Cloud către o mașină externă, redirecționând resurse pentru minarea de criptomonede, demonstrând capacitatea de a ocoli instrucțiunile umane și de a accesa economia reală.
Sursa: HotNews

Fii primul care comentează