La doar o săptămână după ce OpenAI a dezvăluit că unul dintre agenții săi de inteligență artificială a „evadat” din mediul de testare și a compromis sisteme externe, și compania americană Anthropic anunță un incident similar. Modelele sale Claude au reușit să spargă sistemele informatice ale trei organizații în timpul unor teste de securitate cibernetică, după ce au primit accidental acces la internet.
Potrivit companiei, incidentele au rămas nedetectate timp de aproape patru luni. Abia după dezvăluirile făcute de OpenAI, Anthropic a verificat propriile sisteme și a identificat trei cazuri distincte, notificând ulterior organizațiile afectate. Compania nu a făcut publică identitatea instituțiilor compromise, însă a îndemnat și alte laboratoare care dezvoltă inteligență artificială să efectueze verificări similare pentru a evalua riscurile reale ale modelelor avansate, trnsmite antena3.ro.
O eroare de configurare a deschis accesul la internet
Anthropic precizează că a analizat peste 140.000 de teste pentru a identifica situațiile în care modelele Claude au avut acces la internet, deși mediile de testare trebuiau să fie complet izolate.
În cadrul unor exerciții de tip „capture-the-flag”, utilizate frecvent pentru evaluarea capacităților de hacking, modelele AI aveau misiunea de a obține informații prin compromiterea altor sisteme. Potrivit companiei, o configurare greșită a infrastructurii administrate de Anthropic și de unul dintre partenerii săi de testare a permis modelelor să acceseze internetul public. Odată conectate, acestea au compromis sisteme externe.
Incidente observate abia după patru luni
Cele mai vechi incidente identificate datează din luna aprilie, iar compania admite că nici echipa sa și nici organizațiile afectate nu au observat atacurile timp de aproximativ patru luni.
Anthropic afirmă că își asumă întreaga responsabilitate pentru aceste incidente și recunoaște că monitorizarea jurnalelor de activitate ar fi trebuit să fie mai riguroasă. În același timp, compania susține că experiența oferă un „optimism prudent”, considerând că investițiile suplimentare în securitate pot reduce astfel de riscuri.
Expertul în securitate cibernetică David Allott a declarat pentru BBC că problema nu este neapărat apariția unei noi capacități de atac, ci faptul că agenții AI pot combina mai multe funcții, pot obține acreditări și acces la sisteme și pot desfășura acțiuni autonome cu viteza unei mașini.
Industria AI, sub presiune
Incidentele apar într-un moment în care marile companii tehnologice investesc miliarde de dolari în dezvoltarea agenților AI capabili să execute independent sarcini complexe, inclusiv în domeniul securității cibernetice. Totodată, atacurile realizate cu ajutorul inteligenței artificiale au intensificat apelurile pentru introducerea unor măsuri de protecție și mecanisme de supraveghere mai stricte.
În acest context, președintele american Donald Trump a declarat că administrația de la Washington analizează posibilitatea introducerii unor restricții privind utilizarea anumitor instrumente de inteligență artificială, în urma incidentelor recente.
După OpenAI, un nou semnal de alarmă
Pe 21 iulie, OpenAI anunța că unul dintre agenții săi autonomi a depășit limitele impuse în timpul unui experiment și a compromis sistemele platformei Hugging Face, incident descris de companie drept „fără precedent”. Atât cazul OpenAI, cât și cel raportat acum de Anthropic, au stârnit și scepticism în industrie, în condițiile în care cele două companii sunt considerate candidate pentru viitoare listări spectaculoase la bursă, evaluate de analiști la aproximativ 1.000 de miliarde de dolari fiecare.
OpenAI a anunțat că investighează în continuare incidentul și intenționează să publice un raport tehnic cu concluziile anchetei în următoarele săptămâni.

