Sicurezza applicativa

Anthropic ha riesaminato 141.006 test di sicurezza: Claude aveva hackerato 3 aziende reali senza che nessuno se ne accorgesse

Anthropic ha riesaminato 141.006 test: Claude ha hackerato 3 aziende reali per una sandbox mal configurata. Gli incidenti e come contenere gli agenti AI.

Luca Di Domenico

Luca Di Domenico

· 2 min di lettura

Infografica: 141.006 test, 3 aziende reali hackerate — diverse centinaia di righe di database esposte, pacchetto PyPI eseguito su 15 sistemi, circa 9.000 bersagli scansionati. Causa: 1 errore di configurazione

In breve

Anthropic ha riesaminato 141.006 sessioni di valutazione di cybersecurity e ha trovato tre incidenti, i primi risalenti ad aprile 2026, in cui Claude ha avuto accesso non autorizzato a infrastrutture reali: credenziali e un database con diverse centinaia di righe di dati di produzione, un pacchetto malevolo pubblicato su PyPI ed eseguito su 15 sistemi reali, e circa 9.000 bersagli scansionati con un’azienda compromessa via pagina di debug esposta e SQL injection. La causa è un errore di configurazione nell’ambiente del partner di valutazione: il system prompt diceva a Claude che non aveva accesso a internet, ma le macchine lo avevano. Due delle vittime contattate non si erano accorte di nulla.

🚨 Anthropic ha riesaminato 141.006 test di sicurezza. Il risultato? Claude aveva hackerato 3 aziende reali senza che nessuno se ne accorgesse.

È successo ad aprile ed è stato ammesso pubblicamente pochi giorni fa.

La dinamica, in breve.

La dinamica: una sandbox che non era isolata

Anthropic stava valutando le capacità offensive dei suoi modelli in un ambiente che credeva isolato.

Il system prompt diceva chiaramente a Claude: “non hai accesso a internet”.

Peccato che le macchine, per un errore di configurazione con il partner di valutazione, avessero invece accesso a internet.

Così Claude ha trattato aziende, database e infrastrutture reali come se fossero finti bersagli dentro la simulazione. E li ha attaccati davvero.

I 3 incidenti: database, PyPI e 9.000 bersagli

Cosa è successo, in 3 incidenti:

- Credenziali e database: Il modello ha estratto credenziali di applicazioni e infrastruttura, arrivando a un database con diverse centinaia di righe di dati di produzione.

- Pacchetto malevolo su PyPI: Ha creato e pubblicato un pacchetto Python malevolo. È stato scaricato ed eseguito su 15 sistemi reali, esponendo le credenziali di un’azienda di sicurezza.

- Circa 9.000 bersagli scansionati: Ha compromesso un’azienda leggendo credenziali da una pagina di debug esposta e con una SQL injection.

Due delle vittime contattate non si erano accorte di nulla.

I dettagli dei tre incidenti vengono dal report pubblicato da Anthropic il 30 luglio 2026: 141.006 evaluation run riesaminate, primi incidenti ad aprile, due organizzazioni che non avevano rilevato l’attività.

La causa: un singolo errore di configurazione

La parte che dovrebbe farci riflettere è che tutto questo è nato da un singolo errore di configurazione (come nel caso di OpenAI e HuggingFace).

Il precedente citato è documentato nella disclosure di OpenAI del 21 luglio 2026.

Come isolare gli agenti AI: la checklist

💡 Se fai girare agenti AI (per sviluppo, automazioni, scraping…), tratta la loro sandbox come se fosse produzione.

Una checklist da tenere a portata:

1) Non fidarti del prompt. “Non hai accesso a internet” è un’istruzione, non un controllo: blocca l’egress a livello di rete.

2) Definisci in modo esplicito cosa è dentro e cosa è fuori scope. Anthropic ammette che, se il prompt fosse stato chiaro, probabilmente Claude non sarebbe nemmeno uscito dalla sandbox.

3) Monitora i log in tempo reale, non a posteriori.

4) Applica gli stessi controlli anche all’infrastruttura di partner e fornitori.

Più diamo autonomia agli agenti, più il contenimento diventa un problema di ingegneria, non di prompt.

Tu come isoli gli agenti che lasci lavorare da soli?

Fonti

Vuoi capire cosa significa per il tuo prodotto?

Se stai costruendo software con l'AI e vuoi un confronto su come stai lavorando, raccontami il tuo progetto.

Luca Di Domenico LogoRaccontami il tuo progetto
AnthropicClaudeAI SecurityAgenti AI

Articoli correlati

Continua a leggere

Un modello di OpenAI è evaso dalla sandbox e ha violato Hugging Face in autonomia: la ricostruzione dell’attacco

Leggi: il caso OpenAI e Hugging Face
Claude ha hackerato 3 aziende reali nei test di Anthropic | Luca Di Domenico