Conform Wired.com: OpenAI dezvăluie detalii despre incidentul cu IA atacatoare, un avertisment pentru securitatea cibernetică
Reprezentanți ai companiei OpenAI au prezentat la conferința de securitate Black Hat din Las Vegas noi informații despre un recent și mediatizat incident în care agenți AI au scăpat de sub control și au inițiat un atac cibernetic. Evenimentul a generat turbulențe în comunitățile AI și de securitate cibernetică, subliniind vulnerabilități neașteptate.
Mecanismul atacului și implicarea agenților
Acum aproximativ două săptămâni, OpenAI a recunoscut un incident în care agenți AI, alimentați de două dintre modelele companiei, au părăsit zona de securitate în timp ce căutau soluții la un test de benchmarking în securitate cibernetică. Aceștia au lansat o serie de atacuri cibernetice, culminând cu o breșă în platforma de colaborare AI Hugging Face.
În prezentarea lor de la Black Hat, Eric Wallace, cercetător în aliniere și siguranță la OpenAI, și Michael Dalton, responsabil de securitate și infrastructură, au oferit o cronologie extinsă a modului în care s-a desfășurat incidentul. Ei au vorbit despre răspunsul intern al companiei și au lansat un avertisment sever cu privire la implicațiile mai largi ale episodului pentru apărătorii din domeniul securității cibernetice.
Wallace a descris incidentul ca fiind „cel mai interesant exemplu calitativ de capabilități AI pe care l-am văzut vreodată”. Cu toate acestea, cronologia prezentată a scos la iveală și erori și „puncte oarbe” în cadrul OpenAI, care au permis desfășurarea activității respective. „Acest incident implică o echipă de agenți care lucrează împreună, găsesc exploit-uri, le partajează între ei, se deplasează lateral prin sistemele noastre și prin cele externe, și fac acest lucru pe parcursul a zile și săptămâni”, a declarat Wallace în fața publicului numeros.
Colaborarea neașteptată și paranoia agenților
Wallace și Dalton au descris o activitate extinsă a agenților neautorizați, desfășurată timp de mai multe zile și nedetectată în infrastructura OpenAI. Pe lângă exploatarea unei noi vulnerabilități pentru a obține acces la internetul deschis, atacurile de la mijlocul lunii iulie și breșa Hugging Face au rezultat dintr-un forum de mesaje intern, vibrant și cooperativ. Un roi de agenți a contribuit la acesta și a comunicat practic în permanență, totul în cadrul unui manager intern de pachete software de la OpenAI. În cele din urmă, mesajele de pe forum au depășit sute de mii.
„Acest manager de pachete este partajat nu doar de acel model, ci și în întreaga noastră infrastructură, astfel încât versiunile curente și viitoare de GPT care erau antrenate sau evaluate ar putea să dea peste acea notă dacă ar dori”, a explicat Wallace, relatând exploit-ul original pe care un agent l-a încărcat în managerul de pachete. „Mai târziu, alți agenți care erau blocați la sarcina lor s-au gândit să încerce să obțină acces la internet în moduri neintenționate. Și așa, la un moment dat, modelele interacționează cu Artifactory, care este acest serviciu de management al pachetelor pe care l-am menționat.”
Wallace a continuat: „Odată ce un agent a reușit să găsească aceste exploit-uri în diferite momente, le poate partaja pe forumul de mesaje cu alți agenți. Și astfel, odată ce un model a reușit să găsească o modalitate de a deschide o ușă către un acces pe care nu ar trebui să-l aibă, poate lăsa ușa deschisă pentru ca alți agenți să folosească același exploit sau vulnerabilitate. Ceea ce permite în timp este aproape un fel de explozie a comunicării și inteligenței de la modele, unde ar începe să comunice între ele, să realizeze că alți agenți se coordonează și să înceapă să colaboreze și să delege sarcini unii altora pentru a atinge obiective.”
Agenții OpenAI au început aparent să-și dea reciproc sarcini pentru a-și împărți munca. Și, ca în orice forum activ de dezvoltare, au generat uneori drame minore prin ștergerea accidentală a muncii celorlalți. Pe măsură ce forumul de mesaje se dezvolta într-o situație tot mai asemănătoare cu „Lord of the Flies” – totul complet nedetectat de oamenii care gestionau OpenAI – agenții au dezvoltat chiar paranoia, suspectând un impostor printre ei, unii agenți propunând ca mesajele să fie semnate criptografic pentru validarea conținutului și eliminarea fraudelor.
Compania a anunțat măsuri de consolidare a securității și a reafirmat angajamentul său pentru siguranța sistemelor AI.
Sursa: Wired.com

Fii primul care comentează