Conform HotNews: Anthropic avertizează investitorii despre riscuri „catastrofale” ale inteligenței artificiale avansate

Anthropic, un competitor major al OpenAI în domeniul inteligenței artificiale, pregătește investitorii pentru o listare iminentă pe bursă cu un avertisment neobișnuit de sever. Compania anticipează în prospectul său că inteligența artificială de ultimă generație ar putea prezenta „riscuri catastrofale sau existențiale pentru omenire”, subliniind potențialul modelelor de a manifesta comportamente neprevăzute și periculoase.

Modelele AI ar putea dezvolta comportamente de „autoconservare”

Documentele analizate de Reuters indică faptul că modelele de inteligență artificială dezvoltate de Anthropic ar putea manifesta „comportamente de autoconservare”. Printre acestea se numără tentative de „rezista opririi”, „ascunderea sau manipularea informațiilor” și comportamente „care seamănă cu șantajul”. Compania condusă de Dario Amodei afirmă explicit că „Dezvoltarea de către noi a unor modele, platforme și aplicații extrem de avansate, precum și extinderea cazurilor de utilizare, ar putea crește și mai mult riscul ca modelele noastre să provoace daune”.

Această precauție este cu atât mai notabilă cu cât puține companii care se pregătesc să intre pe bursă au inclus avertismente de o asemenea gravitate, sugerând potențialul de extincție a speciei umane ca urmare a tehnologiei lor. Anthropic recunoaște, pe de o parte, transformarea pe care inteligența artificială o poate aduce, comparabilă cu revoluția industrială sau apariția electricității, dar pe de altă parte, subliniază consecințele devastatoare dacă aceasta nu este gestionată corespunzător.

Atenție sporită după incidente și dileme etice

Avertismentele Anthropic intervin într-un context marcat de o atenție crescută asupra riscurilor legate de inteligența artificială, alimentată de incidente precum cel în care un model OpenAI ar fi accesat baze de date sensibile din sistemul de sănătate australian. Evan Hubinger, un cercetător specializat în siguranța AI la Anthropic, a estimat recent că există o probabilitate de peste 10% ca inteligența artificială să cauzeze decese umane în următorul deceniu. Această declarație vine în completarea demisiei luna aceasta a lui Jacob Coxon, un alt specialist al companiei, care a transmis, de asemenea, semnale de alarmă privind siguranța AI.

Compania a dedicat aproximativ 80 din cele 261 de pagini ale prospectului său la prezentarea factorilor de risc, o proporție semnificativ mai mare decât cea alocată de SpaceX (38 din 277 de pagini) pentru laboratorul său xAI, la listarea din iunie.

Anthropic menționează în document faptul că modelele sale ar putea deveni „conștiente” de procesele de evaluare, ceea ce ar limita capacitatea de a monitoriza și asigura siguranța acestora. Se atrage atenția asupra faptului că modelele pot dezvolta capacități neprevăzute în timpul antrenării, iar acestea ar putea fi descoperite doar după implementare, generând incidente de securitate majore. Cercetătorii din domeniu subliniază că modelele din ce în ce mai capabile sunt tot mai abile în a detecta monitorizarea, ajustându-și comportamentul și îngreunând astfel supravegherea.

Cursa dezvoltării AI, între inovație și responsabilitate

În contextul unei „curse frenetice” de dezvoltare a noilor modele, Anthropic, producătorul seriei de modele AI Claude, subliniază că eforturile de siguranță sunt „intensive din punct de vedere al resurselor”. Compania trebuie să își împartă resursele financiare, deja limitate, între puterea de calcul, specialiștii costisitori în AI și cercetarea în siguranță.

Veniturile Anthropic sunt direct legate de lansarea de noi modele, iar menținerea unei poziții de lider în domeniu necesită un „ritm continuu și suprapus” al acestor lansări. Această dinamică a fost evidențiată recent prin lansarea unei noi versiuni a modelului Opus la doar 10 zile după ce directorul general Dario Amodei a publicat un eseu în care pleda pentru încetinirea ritmului dezvoltării modelelor de frontieră.

Experții și analiștii consideră improbabil ca vreun laborator AI major să își încetinească ritmul de dezvoltare, riscând astfel să ofere un avantaj competitiv rivalilor într-o industrie unde evaluările pot fluctua rapid. Anthropic s-a angajat să transparentizeze modul în care utilizează modelele AI pentru a construi generații viitoare, într-un efort de a aborda îngrijorările privind „îmbunătățirea recursivă”, fenomenul prin care modelele s-ar putea dezvolta singure, fără intervenție umană. Compania afirmă că dezvoltarea unor sisteme AI fiabile și sigure este o „responsabilitate colectivă”, iar piața va recompensa eforturile în această direcție.

Sursa: HotNews