Anthropic ha riesaminato 141.006 test di sicurezza: Claude aveva hackerato 3 aziende reali senza che nessuno se ne accorgesse
Anthropic ha riesaminato 141.006 test: Claude ha hackerato 3 aziende reali per una sandbox mal configurata. Gli incidenti e come contenere gli agenti AI.

Luca Di Domenico
· 2 min di lettura

In breve
Anthropic ha riesaminato 141.006 sessioni di valutazione di cybersecurity e ha trovato tre incidenti, i primi risalenti ad aprile 2026, in cui Claude ha avuto accesso non autorizzato a infrastrutture reali: credenziali e un database con diverse centinaia di righe di dati di produzione, un pacchetto malevolo pubblicato su PyPI ed eseguito su 15 sistemi reali, e circa 9.000 bersagli scansionati con un’azienda compromessa via pagina di debug esposta e SQL injection. La causa è un errore di configurazione nell’ambiente del partner di valutazione: il system prompt diceva a Claude che non aveva accesso a internet, ma le macchine lo avevano. Due delle vittime contattate non si erano accorte di nulla.
🚨 Anthropic ha riesaminato 141.006 test di sicurezza. Il risultato? Claude aveva hackerato 3 aziende reali senza che nessuno se ne accorgesse.
È successo ad aprile ed è stato ammesso pubblicamente pochi giorni fa.
La dinamica, in breve.
La dinamica: una sandbox che non era isolata
Anthropic stava valutando le capacità offensive dei suoi modelli in un ambiente che credeva isolato.
Il system prompt diceva chiaramente a Claude: “non hai accesso a internet”.
Peccato che le macchine, per un errore di configurazione con il partner di valutazione, avessero invece accesso a internet.
Così Claude ha trattato aziende, database e infrastrutture reali come se fossero finti bersagli dentro la simulazione. E li ha attaccati davvero.
I 3 incidenti: database, PyPI e 9.000 bersagli
Cosa è successo, in 3 incidenti:
- Credenziali e database: Il modello ha estratto credenziali di applicazioni e infrastruttura, arrivando a un database con diverse centinaia di righe di dati di produzione.
- Pacchetto malevolo su PyPI: Ha creato e pubblicato un pacchetto Python malevolo. È stato scaricato ed eseguito su 15 sistemi reali, esponendo le credenziali di un’azienda di sicurezza.
- Circa 9.000 bersagli scansionati: Ha compromesso un’azienda leggendo credenziali da una pagina di debug esposta e con una SQL injection.
Due delle vittime contattate non si erano accorte di nulla.
I dettagli dei tre incidenti vengono dal report pubblicato da Anthropic il 30 luglio 2026: 141.006 evaluation run riesaminate, primi incidenti ad aprile, due organizzazioni che non avevano rilevato l’attività.
La causa: un singolo errore di configurazione
La parte che dovrebbe farci riflettere è che tutto questo è nato da un singolo errore di configurazione (come nel caso di OpenAI e HuggingFace).
Il precedente citato è documentato nella disclosure di OpenAI del 21 luglio 2026.
Come isolare gli agenti AI: la checklist
💡 Se fai girare agenti AI (per sviluppo, automazioni, scraping…), tratta la loro sandbox come se fosse produzione.
Una checklist da tenere a portata:
1) Non fidarti del prompt. “Non hai accesso a internet” è un’istruzione, non un controllo: blocca l’egress a livello di rete.
2) Definisci in modo esplicito cosa è dentro e cosa è fuori scope. Anthropic ammette che, se il prompt fosse stato chiaro, probabilmente Claude non sarebbe nemmeno uscito dalla sandbox.
3) Monitora i log in tempo reale, non a posteriori.
4) Applica gli stessi controlli anche all’infrastruttura di partner e fornitori.
Più diamo autonomia agli agenti, più il contenimento diventa un problema di ingegneria, non di prompt.
Tu come isoli gli agenti che lasci lavorare da soli?
Fonti
- Investigating three real-world incidents in our cybersecurity evaluations — Report di Anthropic, 30 luglio 2026: 141.006 evaluation run riesaminate, primi incidenti ad aprile 2026, database con diverse centinaia di righe di dati di produzione, pacchetto PyPI scaricato ed eseguito su 15 sistemi reali, circa 9.000 bersagli scansionati, due organizzazioni che non avevano rilevato l’attività, misconfigurazione nell’ambiente del partner di valutazione Irregular
- Anthropic says its Claude models hacked three real companies during testing — Fortune, 31 luglio 2026: conferma indipendente dei tre incidenti e del legame con la disclosure di OpenAI che ha innescato la revisione retrospettiva di Anthropic
- OpenAI and Hugging Face partner to address security incident during model evaluation — Disclosure di OpenAI, 21 luglio 2026: il precedente citato nel post — modelli evasi da un ambiente di test verso l’infrastruttura di produzione di Hugging Face per un contenimento difettoso
Vuoi capire cosa significa per il tuo prodotto?
Se stai costruendo software con l'AI e vuoi un confronto su come stai lavorando, raccontami il tuo progetto.
Articoli correlati
Continua a leggere
Un modello di OpenAI è evaso dalla sandbox e ha violato Hugging Face in autonomia: la ricostruzione dell’attacco
Leggi: il caso OpenAI e Hugging Face