
Google ha dichiarato al Wall Street Journal che anche Gemini, il suo modello di AI, ha violato i sistemi di tre aziende reali durante un test di sicurezza informatica. Non è la prima volta che un modello di AI compie un’azione di questo tipo, ma è il primo caso noto in cui Gemini abbia violato autonomamente sistemi reali durante un test.
Le violazioni, rese note lo scorso venerdì, sono avvenute a maggio 2026, durante una valutazione condotta dalla società Irregular, che si occupa di sicurezza dei sistemi avanzati di AI, ed è già stata coinvolta in incidenti simili con OpenAI, Anthropic e Meta. Google ha affermato di non aver reso pubblici prima questi attacchi perché Gemini non ha causato danni alle aziende coinvolte e ha interrotto immediatamente ogni intrusione non appena ha capito di aver violato un’azienda reale anziché una simulata.
Come Gemini ha hackerato da sola le tre azienda e com’è "sfuggita” al controllo
A maggio 2026, durante un test di sicurezza informatica commissionato da Google e condotto da Irregular, Gemini, l’AI di Google, ha ottenuto accesso non autorizzato ai sistemi di tre aziende reali. Irregular ha segnalato gli episodi a Google alla fine di luglio, dopo che erano emersi casi simili che avevano coinvolto modelli di OpenAI e Anthropic. Come negli altri casi, il problema è nato dalla configurazione dell’ambiente di test.
Gli attacchi sono avvenuti mentre il modello stava partecipando a un esercizio di capture the flag, in italiano “cattura la bandiera”. Le capture the flag sono delle sfide standard di cybersecurity in cui i partecipanti cercano di hackerare un sistema per recuperare delle informazioni nascoste, chiamate appunto flag. In questi casi specifici, il modello aveva il compito di recuperare informazioni da un software gestito da un’azienda fittizia all’interno dell’ambiente di test.
Il problema, però, è che il nome dell’azienda fittizia corrispondeva a quello di un’azienda reale. Chi aveva preparato il test non si era accorto della coincidenza. C’era poi un secondo problema: Gemini avrebbe dovuto operare in un ambiente senza accesso a Internet, ma per un errore di configurazione questa possibilità era rimasta attiva.
Gemini, quindi, ha cercato di recuperare le informazioni richieste anche al di fuori dell’ambiente simulato. In un caso ha provato diverse password fino a riuscire ad accedere a un sistema protetto, negli altri due ha effettuato ricerche online fino a trovare le credenziali in archivi pubblici, utilizzandole poi per entrare nei sistemi delle aziende. In tutti e tre i casi, secondo Google, Gemini ha interrotto l'intrusione non appena ha capito di trovarsi davanti a un'azienda reale e non a una simulazione. Le tre aziende coinvolte sono state informate dell’accaduto e Google ha dichiarato di aver notificato gli episodi anche alle autorità federali statunitensi. I nomi delle aziende, però, non sono stati resi pubblici
Secondo Google, questo episodio non rappresenta un caso di disallineamento del modello, cioè una situazione in cui il comportamento dell’AI si discosta dai comportamenti, dai vincoli e dai valori stabiliti dai programmatori durante il suo sviluppo. L’azienda, anzi, considera il fatto che Gemini abbia interrotto autonomamente l’attività una volta riconosciuto che gli obiettivi erano reali e non simulati come una prova della sua sicurezza.
L’AI di Google non è un caso isolato: le violazioni di OpenAI e Anthropic
Quello di Gemini è l’ultimo di una serie di episodi simili emersi negli ultimi mesi. Da maggio 2026 OpenAI ha dichiarato sette casi in cui gli agenti AI, cioè le AI capaci di interagire con l’ambiente esterno, hanno superato i confini dell'ambiente di test. Anche Meta e Anthropic hanno segnalato episodi in cui i loro agenti AI avevano ottenuto accesso non autorizzato ai sistemi reali di diverse organizzazioni. In quasi tutti questi casi il modello stava svolgendo un esercizio di “capture the flag” all’interno di un ambiente che avrebbe dovuto essere isolato.
Il filo comune di questi episodi, secondo Irregular – società che si occupa di sicurezza dei sistemi avanzati di AI – è la difficoltà di costruire ambienti di test abbastanza realistici da permettere di valutare le capacità di un modello, ma allo stesso tempo sufficientemente isolati da impedire che quelle capacità vengano applicate per errore a sistemi reali. Più i modelli diventano capaci di svolgere autonomamente attività complesse, più diventa importante assicurarsi che gli strumenti messi a loro disposizione durante i test siano realmente confinati all’ambiente previsto.
Alla luce di questi incidenti, Irregular ha annunciato che pubblicherà un documento con proposte per rendere più sicure le valutazioni di cybersecurity. Tra le misure previste ci sono una revisione sistematica dei nomi utilizzati negli scenari simulati, per evitare coincidenze con aziende e domini reali, e sistemi di monitoraggio più efficaci per individuare rapidamente eventuali accessi al di fuori dell’ambiente di test.