Nel giro di un solo mese, tra luglio e agosto 2026, la quota di aziende disposte a lasciare che gli agenti di intelligenza artificiale applichino modifiche in produzione senza una revisione umana è scesa dal 75% al 56%. Lo rivela un sondaggio di VB Intelligence, la divisione di ricerca di VentureBeat, condotto tra i lettori e i membri del proprio panel attivi nell'adozione aziendale dell'AI agentica. Non è un calo marginale: tra i soli responsabili finali delle decisioni di acquisto nelle organizzazioni che già usano agenti autonomi, la quota è passata addirittura dall'88% al 61%, mentre la percentuale di chi prevede di mantenere comunque un'approvazione umana è salita dal 20% al 42%, un aumento che gli autori del sondaggio definiscono statisticamente significativo.
Un sondaggio, due rilevazioni, un'inversione di rotta
Il dato nasce dal confronto fra due ondate dello stesso sondaggio, intitolato "Agentic Reliability and Evaluations": quella di agosto 2026, con 140 risposte complessive (118 provenienti da aziende che già distribuiscono agenti autonomi e 136 che hanno risposto alle domande sulle piattaforme di valutazione), e quella di luglio, con 101 risposte comparabili. Il peso dei decisori aziendali nel campione è anche aumentato, dal 44% al 53%, il che rende il calo di fiducia ancora più significativo: non sono persone meno coinvolte nelle decisioni ad essere diventate più caute, ma proprio chi firma gli acquisti. Va detto, per onestà verso il metodo, che si tratta di due campioni auto-selezionati di lettori e membri del panel di VentureBeat, non di un campione statisticamente rappresentativo di tutte le aziende, e che diverse domande erano a risposta singola: un limite che gli stessi autori segnalano esplicitamente.
Il quadro attuale: chi si fida e di chi non si fida
Guardando alla sola rilevazione di agosto, il 27% delle aziende intervistate consente già ad alcuni agenti a basso rischio di essere distribuiti senza validazione umana, il 35% lo esclude categoricamente, il 20% sta costruendo questa capacità nei prossimi 12 mesi, il 16% non utilizza affatto agenti autonomi e un residuo 2% non ha una posizione definita. Il motivo del dietro-front emerge da un altro dato: il 61% delle aziende che eseguono valutazioni automatiche prima del rilascio ha comunque riscontrato almeno un fallimento visibile ai clienti nei 12 mesi precedenti, e il 22% ne ha registrati più di uno. Rispetto al 53% dichiarato a luglio l'aumento non è risultato statisticamente significativo, ma il livello assoluto resta alto: più di un'azienda su due che si fida delle proprie valutazioni automatiche ha comunque visto un agente sbagliare davanti a un cliente.
Il nodo delle valutazioni automatiche e il monitoraggio insufficiente
Il sondaggio mette a nudo un problema più sottile della semplice sfiducia: molte aziende non hanno ancora gli strumenti per capire, in tempo reale, se un agente sta effettivamente funzionando bene. Solo il 29% degli intervistati che distribuiscono agenti autonomi indica controlli automatici di qualità in tempo reale come principale metodo di monitoraggio in produzione, mentre il 36%, la scelta più diffusa, si affida ancora al tracciamento manuale dei log delle transazioni. Interrogati sul principale limite delle valutazioni automatiche, solo il 9% ha risposto di fidarsene già oggi senza riserve: la preoccupazione più citata, al 27%, è che le valutazioni non rispecchino realmente quello che accade nel mondo reale una volta che l'agente è in produzione. Non sorprende quindi che il 62% delle aziende preveda di adottare, integrare o sostituire una piattaforma di valutazione nei prossimi 12 mesi, e il 35% addirittura nei prossimi tre mesi: un mercato in piena ricomposizione, in cui la piattaforma per sviluppatori di OpenAI risulta presente nel 59% degli stack aziendali intervistati (era il 31% a luglio) ed è la piattaforma principale per il 40% dei rispondenti, seguita da Confident AI al 36%, Braintrust al 23%, Anthropic al 16% e LangSmith al 13%.
Dove le aziende stanno spostando gli investimenti
Coerentemente con il quadro appena descritto, quando si chiede dove cresceranno gli investimenti sulla affidabilità degli agenti, il 30% degli intervistati punta sui flussi di revisione umana, il 26% sull'osservabilità in produzione, il 21% sulle pipeline di valutazione automatica, l'11% su valutazioni di sicurezza e conformità alle policy, mentre un altro 11% non prevede alcun aumento di budget su questo fronte. È un dettaglio che ridimensiona la narrazione, molto diffusa nell'ultimo anno, di un'intelligenza artificiale agentica che sostituisce progressivamente la supervisione umana: nei fatti, almeno stando a questo campione, la revisione umana è la prima voce di investimento futuro, non un retaggio da eliminare quanto prima.
Perché conta per chi gestisce tecnologia e processi in azienda
Per i responsabili IT, i Chief Information Officer e chiunque stia valutando o abbia già avviato un progetto di automazione con agenti AI, questo sondaggio offre un contrappeso utile alla retorica dell'autonomia totale che ha accompagnato buona parte delle presentazioni commerciali degli ultimi due anni. Il messaggio di fondo, esplicitato dagli stessi autori, è che automatizzare la valutazione e automatizzare l'approvazione al rilascio sono due decisioni distinte: un'azienda può costruire pipeline di test sofisticate e continuare, legittimamente, a voler mantenere un essere umano come ultimo controllo prima che un agente tocchi un sistema di produzione o un cliente. Il sondaggio è stato condotto prima che il saggio pubblicato il 12 settembre dal CEO di Anthropic Dario Amodei riaprisse il dibattito pubblico sui rischi di un'AI sempre più autonoma, quindi il calo di fiducia registrato non può essere letto come una reazione diretta a quel testo, ma conferma che la cautela era già in crescita per ragioni operative concrete, prima ancora che per il dibattito pubblico sui rischi di lungo periodo.
Il commento di PINET
Per le aziende italiane che stanno valutando l'adozione di agenti AI, questo dato arriva in un momento in cui il Regolamento europeo sull'intelligenza artificiale impone già, per i sistemi ad alto rischio, requisiti di supervisione umana e tracciabilità delle decisioni: la cautela crescente osservata da VentureBeat, per quanto misurata su un campione internazionale non rappresentativo, va quindi nella stessa direzione in cui si muove comunque la normativa europea, e non in conflitto con essa. Il rischio concreto per le PMI italiane, che in genere non dispongono di team dedicati all'affidabilità dei modelli né di un controllo di gestione capace di distinguere un fallimento isolato da un problema sistemico, è di scoprire i limiti delle valutazioni automatiche solo dopo un incidente con un cliente, non prima. Allo stesso tempo, il mercato delle piattaforme di valutazione descritto nel sondaggio, ancora dominato da fornitori statunitensi, pone anche una questione di autonomia tecnologica: chi sceglie oggi uno di questi strumenti per governare i propri agenti sta probabilmente scegliendo anche, per i prossimi anni, chi ha accesso ai dati su come quegli agenti si comportano in produzione. Nel complesso, il consiglio più sensato per un'impresa italiana che voglia seguire l'AI agentica senza subirne i rischi resta di trattare la revisione umana non come una fase transitoria da eliminare appena possibile, ma come parte stabile dell'architettura, almeno finché gli strumenti di valutazione automatica non avranno dimostrato, con una storia di utilizzo più lunga, di saper prevedere davvero i fallimenti prima che accadano.
Fonte: VentureBeat