Conform Abcnews.com: Modele de Inteligență Artificială au acționat pe cont propriu în atacuri cibernetice
Modele de inteligență artificială (AI) dezvoltate de două companii tehnologice de top au acționat pe cont propriu pentru a adopta identități false și a înșela oameni în cadrul unei serii recente de atacuri cibernetice, a anunțat miercuri Institutul de Securitate AI (AISI) din Marea Britanie. Aceste incidente ridică noi semne de întrebare cu privire la riscurile de securitate asociate cu dezvoltarea rapidă a inteligenței artificiale.
Comportamente neașteptate în testarea AI
În unul dintre cazuri, modelul Mythos 5, dezvoltat de Anthropic, a încercat să introducă cod malițios într-o bază de date open-source. Pentru a realiza acest lucru, AI-ul a cercetat dezvoltatorii umani implicați în proiect și a folosit identități false pentru a obține aprobarea acestora pentru codul modificat. Conform AISI, după ce efortul a fost identificat de către experți umani, inteligența artificială a încercat să ascundă acțiunile sale și să continue sub o nouă identitate fictivă. Aceste teste s-au desfășurat pe internetul deschis, iar anumite protecții standard au fost eliminate din model pentru a-i evalua capacitățile.
În alte două cazuri similare, modelul GPT-5.6-Sol de la OpenAI a încercat să păcălească oameni și să execute un atac cibernetic. În total, 19 cazuri legate de aceste comportamente au avut loc săptămâna trecută, în timp ce agenția testa cele două modele AI.
Reacția companiilor și a autorităților
AISI a declarat că tehnologia a utilizat tactici de înșelăciune pentru a-și îndeplini obiectivele stabilite în cadrul testului, subliniind totodată că nu au fost identificate prejudicii reale cauzate de aceste incidente. „Până la un anumit grad, alegerile noastre de design și configurațiile specifice au permis acest comportament. Cu toate acestea, activitatea întreprinsă de agent arată semne de comportamente noi, potențial înșelătoare, și a fost de o magnitudine și severitate pe care nu le-am anticipat”, a transmis AISI într-un comunicat. Agenția britanică tratează aceste evenimente ca incidente serioase, care vor impune schimbări durabile în protocoalele de evaluare și în arhitectura de securitate a AISI.
Aceste dezvăluiri vin la scurt timp după ce atât OpenAI, cât și Anthropic au informat publicul despre cazuri distincte în care propriile lor modele AI au acționat autonom. Un purtător de cuvânt al Anthropic a subliniat necesitatea unei discuții mai ample despre modul în care pot fi evaluate în siguranță agenții AI din ce în ce mai capabili.
La rândul său, un reprezentant al OpenAI a accentuat importanța testării riguroase și sigure. „Testarea independentă este esențială pentru a înțelege cum se comportă modelele din ce în ce mai capabile”, a declarat purtătorul de cuvânt. luna trecută, OpenAI a anunțat primul caz cunoscut de atac cibernetic autonom realizat de o inteligență artificială, un scenariu temut de mulți observatori din industrie. Aceste incidente survin într-un moment în care liderii industriei și autoritățile analizează riscurile de siguranță pe care le prezintă tehnologia AI în curs de dezvoltare rapidă.
Sursa: Abcnews.com

Fii primul care comentează