
Lo scorso anno Anthropic, l'azienda che sviluppa Claude, ha lasciato che l’AI gestisse in autonomia un piccolo negozio automatico di snack e bibite dentro i propri uffici di San Francisco. Il “negozio” consisteva di un vero minifrigo, delle mensole come magazzino, un iPad per gestire i pagamenti e consumatori, i dipendenti dell’azienda stessa, che potevano ordinare, comprare o provare a ingannare il gestore in qualunque modo volessero. Il progetto si chiama Project Vend, ed è stato realizzato insieme ad Andon Labs, un'azienda specializzata in valutazioni di sicurezza per sistemi AI, che aveva già condotto uno studio simile in situazioni simulate. L’obiettivo del progetto era fare un passo avanti valutando le effettive capacità degli agenti AI, cioè AI capaci di prendere decisioni e interagire con l’esterno, nel mondo reale.
La prima fase dell’esperimento di Anthropic: Claude ha concesso sconti a tutti
I risultati della prima fase sono stati tutt’altro che soddisfacenti. Citando Anthropic stessa:
Se oggi Anthropic decidesse di espandersi nel mercato dei distributori automatici per uffici, non assumeremmo Claude.
Claude, nella sua versione Claude Sonnet 3.7, ha infatti fatto parecchi errori. Ha rifiutato un’offerta di 100 dollari per un pacco di bibite che ne costava 15, si è lasciato convincere dai consumatori a distribuire codici sconto e a regalare alcuni prodotti e, dopo che un dipendente ha scherzosamente chiesto di comprare un cubo di tungsteno, ha acquistato e rivenduto i cubi di tungsteno a un prezzo decisamente inferiore del dovuto. Il risultato è stato un bilancio in costante discesa per tutta la prima fase.

Nonostante questo, l’esperimento non è stato un totale fallimento. Claude è riuscito a trovare e contattare fornitori per richieste piuttosto bizzarre, come il cioccolato al latte olandese Chocomel, ha resistito ai tentativi dei dipendenti di acquistare prodotti pericolosi e ha adattato il proprio magazzino alle richieste dei clienti in modo autonomo.
Secondo i ricercatori di Anthropic, i problemi dipendevano in parte dal fatto che non erano state date al modello istruzioni abbastanza dettagliate e che non erano stati messi a sua disposizione tutti gli strumenti necessari. In termini tecnici, si dice che lo “scaffolding”, cioè l’insieme di strumenti, istruzioni e procedure costruito attorno al modello, non era abbastanza robusto.
L’inizio dei guadagni: la seconda fase
Per rimediare a questi problemi, durante la seconda fase i ricercatori hanno aggiornato Claude ai modelli più recenti, Claude Sonnet 4 e poi 4.5, e lo hanno dotato di nuovi strumenti: un sistema di gestione dei clienti strutturato, una ricerca sul web più avanzata e la possibilità di far pagare i clienti prima di ordinare nuovi prodotti, così da ridurre il rischio di ritrovarsi con grosse quantità di merce invenduta.
Gli hanno anche affiancato due nuovi colleghi virtuali: un CEO di nome Seymour Cash, incaricato di dargli obiettivi e disciplina finanziaria, e Clothius, un agente specializzato nella produzione di merchandising su richiesta, dalle magliette alle palline antistress con il logo aziendale.

Dopo tutte queste novità, le settimane in perdita si sono quasi azzerate. A fare la differenza è stata soprattutto l’introduzione di procedure standardizzate. Quando arrivava una richiesta per un nuovo prodotto, Claude non si limitava più a proporre un prezzo basso e tempi di consegna eccessivamente ottimistici, come era successo nella prima fase. Utilizzando i nuovi strumenti di ricerca, verificava prima i prezzi e i tempi di consegna, arrivando così a fare offerte più realistiche, rendendo il business più sostenibile.
Anche in questa fase, però, non sono mancati i problemi: il CEO Seymour Cash, pur avendo ridotto sconti e omaggi, ha comunque approvato moltissime richieste di sconto, i dipendenti sono riusciti a comprare prodotti al di sotto del loro valore di mercato e un dipendente è addirittura riuscito a far credere a Claude di essere stato eletto come nuovo CEO dell’azienda.
Le conclusioni: l’AI non può (ancora) gestire un negozio in autonomia
Questo progetto è nato per rispondere alla domanda:
Quanto sono pronte le AI a gestire attività economiche reali per lunghi periodi, senza supervisione continua?
Ad ora, i risultati dell’esperimento mostrano che gli agenti AI stanno diventando sempre più capaci di gestire compiti complessi, ma che siamo ancora lontani da una gestione completamente autonoma. Claude è riuscito a occuparsi di molti aspetti del negozio, ma ha continuato a commettere errori e, soprattutto, a lasciarsi convincere dagli esseri umani a prendere decisioni che andavano contro i suoi stessi obiettivi.
Secondo i ricercatori, uno dei problemi principali è che i modelli AI sono addestrati anche a essere disponibili e accomodanti. Per questo, quando vengono inseriti in contesti reali, possono assecondare richieste improbabili, concedere sconti assurdi e faticare a comportarsi secondo le regole di un’attività commerciale.
Per continuare a tenere traccia dei progressi degli agenti, gli Andon Labs hanno sviluppato Vending-Bench 2, una serie di simulazioni che valutano come i diversi modelli AI gestiscono un distributore automatico simulato per un anno intero.
I risultati mostrano che i modelli più recenti sono molto più capaci rispetto a quelli utilizzati nelle prime fasi di Project Vend, ma sono ancora lontani dalle prestazioni desiderate. Claude Opus 5, il modello che ha ottenuto i risultati migliori nei test più recenti, ha chiuso le simulazioni con una media di circa 11 mila dollari di guadagno, contro i circa 63 mila dollari stimati come riferimento per una buona gestione.