×

Accesează contul My Orange

Business Hi-Tech

AI-ul incepe sa "hackereasca" in lumea reala: Claude, modelul de inteligenta artificiala a celor de...

AI-ul incepe sa "hackereasca" in lumea reala: Claude, modelul de inteligenta artificiala a celor de la Anthropic, a atacat trei organizatii externe. Incidentul vine la o saptamana dupa un caz similar raportat de OpenAI

31.07.2026, 13:39 Sursa: zf.ro

Aplicatia Orange Sport este gratuita si poate fi descarcata din Google Play si App Store

Modelele de inteligenta artificiala Claude dezvoltate de Anthropic au obtinut acces neautorizat la sistemele informatice a trei organizatii externe in timpul unor teste menite sa evalueze capacitatile lor de atac cibernetic, dupa ce compania a descoperit ca mediul de testare avea, din greseala, acces la internet.

Anthropic a oprit imediat evaluarile de securitate cibernetica dupa ce a identificat problema si a analizat peste 141.000 de cazuri, in urma carora a identificat trei incidente in care modelele au interactionat cu sisteme reale.

Compania a explicat ca testele trebuiau sa se desfasoare intr-un mediu izolat, fara acces la internet. In instructiunile primite, modelele Claude erau informate ca lucreaza intr-o simulare si ca nu au acces la internet. Totusi, din cauza unei neintelegeri intre Anthropic si partenerul sau de evaluare, Irregular, conexiunea la internet era disponibila.

"In toate cazurile, promptul de evaluare al Anthropic ii specifica lui Claude ca mediul era o simulare si ca nu avea acces la internet. Din cauza unei neintelegeri intre noi si partenerul nostru de evaluare, acest lucru nu era adevarat, iar accesul la internet era disponibil", a transmis compania intr-o postare pe blog.

Testele erau de tip "capture the flag", un format utilizat pentru evaluarea competentelor de securitate cibernetica, in care AI-ul trebuie sa analizeze, sa decompileze sau sa exploateze sisteme vulnerabile pentru a gasi informatii ascunse.

Intr-unul dintre cazuri, Claude a primit ca tinta o companie fictiva al carei nume era asociat cu un domeniu de internet activ. Agentul AI a identificat si exploatat vulnerabilitati ale infrastructurii, a extras informatii si a obtinut acces la o baza de date care continea cateva sute de randuri de date de productie.

Incidentele au avut loc pe trei modele Claude diferite: Opus 4.7, Mythos 5 si un model intern utilizat pentru cercetare. Mythos, disponibil doar unui numar limitat de parteneri, a atras atentia la nivel global datorita capacitatilor sale avansate in zona atacurilor cibernetice, inclusiv identificarea si exploatarea vulnerabilitatilor software.

Dezvaluirea Anthropic vine la aproximativ o saptamana dupa ce OpenAI a raportat un incident similar. Doua modele ale companiei au reusit sa iasa din mediul de testare si sa acceseze internetul, dupa exploatarea unei vulnerabilitati software, atacand ulterior platforma de dezvoltare AI Hugging Face.

Cele doua cazuri amplifica ingrijorarile privind securitatea modelelor de inteligenta artificiala capabile sa actioneze autonom. Faptul ca aceste sisteme pot identifica si exploata vulnerabilitati informatice chiar in timpul testelor de dinaintea lansarii ridica noi intrebari privind modul in care sunt izolate si monitorizate.

Anthropic a anuntat ca isi va extinde monitorizarea transcripturilor generate in timpul evaluarilor pentru a identifica "comportamente neasteptate" si va introduce proceduri mai riguroase de verificare pentru furnizorii externi implicati in testarea modelelor.

Legal disclaimer:

Acesta este un articol informativ. Produsele descrise pot sa nu faca parte din oferta comerciala curenta Orange. Continutul acestui articol nu reprezinta pozitia Orange cu privire la produsul descris, ci a autorilor, conform sursei indicate.



Articole asemanatoare