Anthropic alocă aproximativ 80 dintre cele 261 de pagini ale corpului principal al prospectului de listare, document încă nepublicat, prezentării factorilor de risc operațional, potrivit unor informații furnizate de Reuters și Financial Times. Prin comparație, descrierea activității companiei ocupă 48 de pagini.
Anthropic menționează printre cele mai grave scenarii posibilitatea ca un AI avansat să prezinte „riscuri catastrofale sau existențiale pentru umanitate”.
Documentul de listare la bursă, menit să prezinte situația financiară, planurile de expansiune și profilul de risc al societății avertizează că modelele de inteligență artificială ar putea manifesta „comportamente de autoprezervare”. Printre acestea se numără încercări active de a „se opune închiderii”, de a „ascunde sau de a manipula informații” și comportamente „asemănătoare șantajului”.
„Dezvoltarea de către noi a unor modele, platforme și aplicații extrem de avansate și extinderea cazurilor de utilizare ar putea crește și mai mult riscul ca modelele noastre să provoace prejudicii”, se arată în relatările privind documentul intern, citate de The Guardian.
Mai mult, reprezentanții Anthropic notează că o limitare semnificativă în evaluarea siguranței o reprezintă posibilitatea ca modelul să fie conștient de faptul că este testat.
Contactați de presă, reprezentanții Anthropic au refuzat să comenteze informațiile. Deși companiile care urmează să se listeze la bursă includ în mod obișnuit riscurile operaționale sau de reglementare, admiterea explicită că un produs ar putea duce la dispariția rasei umane subliniază nivelul de îngrijorare din industrie.
Avertismentele vin pe fondul unor controverse tot mai aprinse în comunitatea de cercetare. Recent, Jacob Coxon, cercetător în cadrul Anthropic, a demisionat avertizând că dezvoltatorii „cred cu sinceritate că această tehnologie ne-ar putea ucide pe toți până la sfârșitul deceniului”, citează The Guardian.
Afirmația sa a fost susținută public pe platforma X de un cercetător senior în siguranța AI din aceeași companie, care a estimat la peste 10% probabilitatea ca AI să provoace dispariția umanității în următorul deceniu.
La scurt timp, directorul general al Anthropic, Dario Amodei, a făcut un apel public afirmând că industria „trebuie să încetinească ritmul în care îmbunătățim capacitățile modelelor AI”.
De cealaltă parte, unii experți din domeniu critică aceste discursuri, susținând că avertismentele privind riscul existențial lipsesc de o bază științifică clară și nu pot fi verificate.
Cu toate acestea, incidente recente aduc în prim-plan vulnerabilitățile tehnologiei: agenți autonomi dezvoltați de OpenAI au spart sistemele informatice ale zeci de organizații terțe, printre care platforma Hugging Face și sistemul universal de sănătate din Australia.
Totodată, OpenAI a anunțat luni că a anulat lansarea modelului său GPT-6.1 Astra din cauze de siguranță, după ce testele au indicat un nivel ridicat de comportament înșelător și rezultate slabe la capitolul de aliniere („alignment”) – procesul prin care modelele sunt instruite să respecte valorile și obiectivele umane, relatează The Guardian.
Citește și: Anthropic avertizează că inteligența artificială se apropie de construirea propriului succesor