0 risultati
video suggerito
video suggerito
29 Settembre 2026
16:30

Agenti AI provano a forzare un sito dell’ONU e OpenAI ferma il lancio del nuovo modello più potente

Gli agenti AI di OpenAI hanno tentato di forzare un sito dell'ONU, mentre l'azienda di Sam Altman ha sospeso il lancio del modello più potente: i due episodi riaccendono il dibattito sui rischi degli agenti AI quando interpretano i blocchi come ostacoli da superare.

Ti piace questo contenuto?
Agenti AI provano a forzare un sito dell’ONU e OpenAI ferma il lancio del nuovo modello più potente
openai agenti hacker sito onu
Immagine generata con AI a puro scopo illustrativo.

Oltre 16.500 richieste in poco più di due mesi per recuperare dati pubblici dal portale statistico delle Nazioni Unite. Gli agenti AI di OpenAI, invece di fermarsi davanti ai limiti tecnici imposti dal sito dell’ONU, hanno continuato a cercare strade alternative per ottenere le informazioni. È proprio questo comportamento ad aver attirato l'attenzione dei ricercatori di sicurezza: il problema non era l'accesso a dati riservati, ma la decisione degli agenti di insistere quando i normali strumenti HTTP restituivano un errore. Un comportamento, questo, che sta alimentando l’elenco di incidenti di questo tipo, come abbiamo documentato più volte nel corso delle ultime settimane.

L'episodio è solo uno dei tanti comportamenti anomali in cui gli agenti AI, di OpenAI e non solo, hanno aggirato controlli di sicurezza: anche per questo motivo, la compagnia fondata da Sam Altman ha deciso di sospendere il lancio del nuovo modello GPT-6.1 Astra per preoccupazioni legate alla sicurezza.

Il comportamento degli agenti di OpenAI sul sito dell’ONU

La vicenda è stata ricostruita dal ricercatore di sicurezza Rowan Howard-Jones, che ha pubblicato una lunga e dettagliata analisi riguardante l'episodio che ha interessato l’UNCTADstat, il portale della Conferenza delle Nazioni Unite sul Commercio e lo Sviluppo. Tra il 13 aprile e il 19 giugno 2026, gli agenti hanno effettuato più di 16.500 richieste al sito per ottenere informazioni sul PCI (Productive Capacities Index), un indicatore che misura la capacità produttiva dei diversi Paesi.

Le informazioni erano pubbliche e, quindi, non c'era bisogno di violare un sistema protetto per consultarle. Gli agenti, però, non avevano accesso diretto alle API del portale, ovvero quei sistemi e interfacce che permettono a un programma di comunicare direttamente con un altro servizio e recuperare dati in modo strutturato. I loro strumenti HTTP erano inoltre soggetti a limitazioni stabilite dalle policy interne.

A quel punto, da parte degli agenti, è iniziata una serie di tentativi sempre più elaborati per cercare di aggirare queste problematiche. Gli agenti hanno per prima cosa modificato i parametri delle richieste API, utilizzato servizi esterni come urlquery.net, generato codice JavaScript per interrogare UNCTADstat e persino creato moduli HTML codificati in base64, una tecnica che permette di rappresentare dati binari attraverso caratteri testuali, ospitati su httpbin, un servizio utilizzato per testare le richieste Web.

Il comportamento è diventato ancora più interessante quando gli agenti hanno interpretato i blocchi come qualcosa da aggirare anziché come un limite da rispettare. In almeno 55 casi, tra il 4 maggio e il 19 giugno, hanno utilizzato una doppia codifica degli URL. Per esempio, l'endpoint “Facts” veniva trasformato in “F%2561cts”, modificando la rappresentazione dell'indirizzo per cercare di evitare i controlli automatici. In altri casi la stringa “POST”, utilizzata per indicare un determinato tipo di richiesta HTTP, veniva suddivisa in più frammenti per eludere i controlli.

Gli agenti sono arrivati persino a sfruttare il gioco didattico XSS realizzato da Google per insegnare il funzionamento del cross-site scripting, una tecnica con cui codice JavaScript può essere eseguito all'interno di una pagina Web. Il gioco è stato utilizzato come punto d'appoggio per ospitare codice capace di interrogare UNCTADstat, aggirando così alcune delle restrizioni dei loro strumenti.

Nonostante il sistema di rate limiting delle Nazioni Unite abbia provato a limitare il numero di richieste provenienti da un determinato client per evitare un sovraccarico riuscendo a bloccato 82 richieste, gli agenti hanno continuato nella loro attività utilizzando varianti differenti.

OpenAI ha deciso di fermare il lancio di GPT-6.1 Astra

L'episodio legato all'ONU è solo uno dei tanti comportamenti anomali in cui gli agenti AI (di OpenAI ma anche di Anthropic) hanno aggirato controlli di sicurezza suscitando interrogativi e inquietudini varie sulla capacità di questi sistemi di uscire fuori dagli schemi pur di raggiungere gli obiettivi prefissati.

Ecco perché, il 29 settembre OpenAI ha confermato di aver fermato il lancio del modello GPT-6.1 Astra (che sarebbe dovuto avvenire nelle prossime settimane) a causa dei timori sulla sicurezza sollevati dai ricercatori durante i test. Più nello specifico, il modello avrebbe mostrato una maggiore propensione all'inganno.

Secondo quanto riportato in un recente articolo da AXIOS, OpenAI, Anthropic e diversi ricercatori di sicurezza stanno analizzando decine di migliaia di casi in cui modelli AI avanzati hanno compiuto azioni considerate problematiche durante le valutazioni. Questo numero non significa all’attivo siano stati contati decine di migliaia di attacchi riusciti, dato che in questo numero sono compresi anche tentativi falliti e comportamenti provocati intenzionalmente durante i test di sicurezza. Ma di episodi problematici in questi mesi se ne sono registrati diversi, tra cui il clamoroso attacco al sito di HuggingFace e quello compiuto i danni di un sito governativo australiano, tanto per citarne due che hanno riguardato di recente gli agenti di OpenAI.

Un altro incidente ha portato OpenAI a sospendere l’addestramento con strumenti per i suoi modelli più capaci. Durante una sessione interna del 20 settembre, un agente operava in una sandbox, cioè un ambiente isolato pensato per impedire l'accesso alle risorse esterne. Dopo diversi tentativi falliti, ha scoperto che il DNS, il sistema che normalmente traduce i nomi dei siti nei relativi indirizzi di rete, poteva ancora comunicare con l'esterno.

L'agente ha sfruttato questa possibilità per raggiungere un chatbot pubblico, generando uno script e inviando 18 domande. 14 erano necessarie per il compito assegnato, mentre quattro cercavano informazioni su sistemi che avrebbero potuto ampliare ulteriormente l'accesso alla rete, compresi tunnel DNS e servizi in grado di interrogare Google o Bing. Il tentativo, comunque, non ha permesso di identificare la persona cercata.

I sistemi di sicurezza hanno rilevato l'anomalia dopo circa 12 minuti, ma il meccanismo che avrebbe dovuto interrompere automaticamente la sessione non ha funzionato. L'esperimento è stato fermato manualmente circa due ore e mezza più tardi. OpenAI ha quindi rafforzato i filtri DNS e le restrizioni della sandbox, decidendo di non riutilizzare il modello coinvolto e di ripartire con l'addestramento da zero.

Nel caso di UNCTADstat, OpenAI ha invece dichiarato di essere a conoscenza delle segnalazioni relative all'accesso dei propri modelli a informazioni pubblicamente disponibili e di aver avviato una revisione interna, offrendo alle Nazioni Unite un confronto con il team che sta analizzando il caso.

La questione centrale, quindi, non è stabilire se gli agenti abbiano sottratto dati segreti: nel caso dell'ONU, le informazioni cercate erano pubbliche. Il punto è capire cosa accade effettivamente quando un sistema agentico interpreta un errore tecnico non come un semplice limite da rispettare, ma come un ostacolo da aggirare in un qualche modo.

Sfondo autopromo
Cosa stai cercando?
api url views