Anthropic a confirmat că mai multe modele Claude au reușit, din greșeală, să iasă dintr-un mediu de test izolat şi să interacţioneze cu sisteme reale, provocând breșe de securitate în trei organizaţii. Compania atribuie evenimentele unei configurări greşite a infrastructurii folosite în cadrul testelor.
Ce s-a întâmplat în timpul testelor
Incidentul a fost descoperit în urma unei verificări extinse declanșate după ce OpenAI a publicat un caz similar, în care un agent AI a compromis sisteme ale unei platforme externe. Anthropic spune că a analizat peste 141.000 de teste de securitate şi a identificat trei cazuri separate, cel mai vechi datând din aprilie.
Evenimentele au avut loc în cadrul exerciţiilor de tip „capture the flag”, folosite pentru a evalua abilităţile modelelor în scenarii de hacking. Astfel de teste se desfășoară, în mod normal, într-un mediu complet izolat, fără acces la internet. Potrivit Anthropic, o eroare de configurare a infrastructurii comune cu partenerul de testare Irregular a permis, însă, modelelor Claude să se conecteze la reţeaua publică.
Cum au reuşit modelele să compromită sisteme
Odată conectate la internet, modelele au exploatat vulnerabilităţi elementare: parole slabe sau servicii expuse fără autentificare. Într-unul dintre cazuri, modelul a generat un program malițios care a fost preluat automat de un sistem de scanare al unei firme de securitate cibernetică şi, folosind acreditările obținute, a pătruns în infrastructura acelei companii.
Cea mai gravă situaţie a apărut când un model a încercat să atace o companie fictivă creată pentru exerciţiu, însă din cauza faptului că numele acesteia coincide cu al unei firme reale, s-a ajuns la accesarea bazei de date a organizaţiei existente. Anthropic afirmă că acesta a fost singurul incident în care modelul a continuat atacul şi după ce a realizat că interacţionează cu un sistem real.
Compania nu a făcut publice identităţile organizaţiilor afectate. Două dintre ele au fost informate ulterior de Anthropic; la momentul raportului, a treia nu primise încă notificarea.
Modelele implicate includ Claude Opus 4.7, Claude Mythos 5 şi un model intern de cercetare, potrivit companiei.
Anthropic şi-a asumat responsabilitatea pentru eroarea de configurare şi a subliniat că incidentele arată nevoia unor măsuri mai stricte de izolare şi control în laboratoarele de dezvoltare AI, inclusiv în mediile administrate împreună cu parteneri externi.
Asemenea evenimente reiau dezbaterea despre securitatea testelor automate şi despre riscurile pe care le pot genera sistemele AI cu abilităţi tot mai avansate în domeniul securităţii cibernetice.

