Articolo · Intelligenza Artificiale

Agenti AI in azienda: cosa dicono le misure

Quattro banchi di prova, un protocollo con la sua data e un comunicato Istat, per dire quanto regge oggi un agente.

Federico BoggiaFederico Boggia ·Intelligenza Artificiale ·Febbraio 2026 ·13 min di lettura

Sugli agenti AI esistono misure pubblicate, e cambiano segno a seconda di come si conta. Su tau-bench un agente chiude il 61,2% dei compiti di servizio clienti alla prima prova; lo stesso compito otto volte di fila gli riesce in meno di un quarto dei casi. Qui ci sono i numeri con la fonte e la data accanto, perché su questo argomento scadono in pochi mesi.

01Che cosa fa un agente, e che cosa no

Un agente AI è un modello linguistico chiuso dentro a un ciclo: riceve un obiettivo, sceglie uno strumento, legge il risultato e decide il passo successivo. Lo schema ha un nome, degli autori e una data. Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan e Yuan Cao lo hanno chiamato ReAct e depositato il 6 ottobre 2022 (arXiv:2210.03629).

La differenza con un chatbot sta in cosa esce dal modello. Un chatbot produce testo. Un agente produce anche chiamate a funzioni, con il nome della funzione e i parametri, che un programma esterno esegue e il cui risultato rientra nel prompt del giro dopo. Il modello resta un generatore di sequenze probabili: il ciclo attorno è quello che trasforma una sequenza probabile in un ordine spedito o in un file cancellato.

Il paper di ReAct misura il guadagno di quel ciclo su due ambienti interattivi. Su ALFWorld il tasso di successo sale di 34 punti assoluti rispetto ai metodi di imitation learning e reinforcement learning, su WebShop di 10 punti, con uno o due esempi nel prompt. Gli stessi autori scrivono che l'alternanza serve a due cose diverse: le tracce di ragionamento aiutano a formulare, seguire e aggiornare il piano e a gestire le eccezioni, le azioni servono a raccogliere informazioni da fonti esterne.

I tre pezzi che servono, e nessuno è il modello

Un agente in produzione ha un modello, una descrizione degli strumenti che può chiamare e un ciclo con una condizione di uscita. Il modello si cambia in un pomeriggio. La descrizione degli strumenti e la condizione di uscita sono il lavoro, e sono quelle che decidono se l'agente si ferma dopo tre giri o dopo trecento.

02Il ciclo ragiona, agisci, osserva

Il ciclo di ReAct ha tre momenti che si ripetono. Il modello scrive un pensiero (thought), emette un'azione (action), riceve un'osservazione (observation) dal programma che ha eseguito l'azione, e riparte con il pensiero successivo. Nessuna delle tre parti è nuova: la novità del 2022 è averle alternate nello stesso flusso di testo, invece di studiare il ragionamento e l'azione separatamente.

Su una sequenza di solleciti la forma è questa. Il modello scrive che per trovare le fatture scadute deve interrogare il gestionale; emette una chiamata allo strumento di query; riceve indietro dodici righe; scrive che ora servono dodici solleciti e comincia dal primo. Il numero dodici nessuno l'ha scritto nel programma: è arrivato dall'osservazione, ed è il punto in cui un agente si comporta diversamente da uno script.

C'è una seconda famiglia, Plan-and-Execute, in cui il modello costruisce prima l'elenco completo dei passaggi e poi lo esegue, rifacendo il piano quando un passaggio fallisce. Le due architetture si distinguono per quando viene presa la decisione.

AspettoReActPlan-and-Execute
Quando decideA ogni giro, dopo l'osservazione precedenteUna volta all'inizio, poi in caso di errore
Chiamate al modelloUna per passo, più le osservazioni nel contestoUna per il piano, poi solo dove serve giudizio
Dove reggePercorso ignoto in partenza, numero di passi variabilePassi noti, dipendenze note, esiti prevedibili

I 34 punti di ALFWorld valgono per i modelli del 2022 e per quei due ambienti. Dal 2022 in poi la parte di ragionamento è finita dentro ai modelli, che producono da sé una catena di passaggi prima di rispondere, quindi lo scarto attribuibile al prompt in stile ReAct si è ridotto. Il ciclo invece è rimasto: è il pezzo di programma che esegue le chiamate e rimette le osservazioni nel contesto, e quello nessun modello se lo porta dentro.

03Agente o automazione: il numero che decide

La misura che separa i due casi esiste, e viene da tau-bench, un banco di prova per compiti di servizio clienti pubblicato il 17 giugno 2024 da Shunyu Yao, Noah Shinn, Pedram Razavi e Karthik Narasimhan (arXiv:2406.12045). Il banco simula la conversazione fra un utente e un agente che ha in mano le API di un dominio e le sue regole scritte: 115 compiti nel dominio della vendita al dettaglio e 50 in quello aereo. Alla fine della conversazione il confronto è fra lo stato del database e lo stato atteso.

Su quel banco gpt-4o chiude il 61,2% dei compiti nel dettaglio e 35,2% nell'aereo. Il numero che conta per chi deve mettere un agente in produzione è un altro, e gli autori lo hanno introdotto apposta: il pass^k, cioè la probabilità che lo stesso compito riesca in tutte le k prove. In retail il pass^8 scende sotto il 25%.

Un agente che riesce sei volte su dieci alla prima prova riesce otto volte su otto in un quarto dei casi. Un processo aziendale gira decine di volte al mese sullo stesso tipo di pratica, quindi la misura da guardare è la seconda. Un workflow deterministico ha pass^k uguale a pass^1 per costruzione, perché ripercorre lo stesso ramo: quando un workflow sbaglia, sbaglia sempre allo stesso modo, e per questo lo si corregge una volta sola.

Regola pratica

La domanda da fare a un processo candidato è quante volte di fila deve riuscire prima che qualcuno se ne accorga. Sotto le tre o quattro ripetizioni un pass^1 del 60% è gestibile con una revisione umana. Sopra le venti, con quei numeri, l'agente produce più lavoro di controllo di quanto ne tolga.

La terza strada è il cancello: un programma deterministico governa il flusso e chiama il modello solo nei punti dove serve giudizio, con una soglia di confidenza sotto la quale la pratica passa a una persona. È il movimento centrale di Divide et Delega: si spezza il lavoro, si decide pezzo per pezzo se è calcolo o giudizio, si delega il calcolo con un cancello, e della decisione risponde una persona. Il giro completo, con il codice, sta in Gen AI per l'automazione dei processi.

04Dove è stato misurato, e quanto invecchiano i numeri

Sui compiti agentici i numeri pubblicati vengono da tre banchi di prova, e ognuno misura una cosa diversa.

Codice: SWE-bench

Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press e Karthik Narasimhan hanno pubblicato SWE-bench il 10 ottobre 2023: 2.294 problemi presi da issue GitHub reali e dalle pull request che le hanno chiuse, su 12 repository Python (arXiv:2310.06770). Il modello migliore misurato nel paper, Claude 2, risolveva l'1,96% dei problemi.

Il sottoinsieme SWE-bench Verified, 500 istanze validate a mano, è quello su cui si confrontano oggi. Sulla classifica ufficiale, consultata il 29 settembre 2026, la voce più alta sta al 79,2% (Sonar Foundation Agent con Claude 4.5 Opus, voce del 5 dicembre 2025), mentre sul set completo da 2.294 problemi la voce migliore si ferma al 52,62% (swebench.com). Le due cifre misurano lo stesso tipo di sistema su due insiemi di problemi diversi, ed è la ragione per cui una percentuale su SWE-bench va letta insieme al nome della variante.

Compiti generali: GAIA

GAIA, pubblicato il 21 novembre 2023 da Grégoire Mialon, Clémentine Fourrier, Craig Swift, Thomas Wolf, Yann LeCun e Thomas Scialom, contiene 466 domande, di cui 300 con la risposta trattenuta per la classifica (arXiv:2311.12983). Sono domande che richiedono ragionamento, lettura di immagini, navigazione web e uso di strumenti. Alla pubblicazione gli esseri umani rispondevano bene nel 92% dei casi, GPT-4 con i plugin nel 15%.

Il rovescio è dichiarato dagli autori stessi: quelle domande sono concettualmente semplici per una persona. Lo scarto di 77 punti si apriva proprio dove un modello vinceva già su compiti da professionisti, in diritto o in chimica. È il motivo per cui le percentuali sui banchi di prova accademici dicono poco su un processo di back office.

Servizio clienti: tau-bench

I 115 compiti di vendita al dettaglio e i 50 aerei di tau-bench sono i più vicini a un processo aziendale, perché l'agente deve rispettare regole di dominio scritte e parlare con un utente simulato. I numeri stanno nel paragrafo precedente, e il pass^8 sotto il 25% in retail è il dato che vale la lettura.

Data di scadenza

Le percentuali di questa sezione valgono alla data indicata accanto a ciascuna. SWE-bench è passato dall'1,96% del 2023 al 79,2% della classifica di oggi in meno di tre anni: una cifra copiata senza la sua data è una cifra sbagliata entro pochi mesi.

Dove sta l'Italia

Il dato italiano lo pubblica l'Istat il 15 dicembre 2025. Nel 2025 usa almeno una tecnologia di intelligenza artificiale il 16,4% delle imprese con almeno dieci addetti, contro l'8,2% del 2024 e il 5,0% del 2023. La forbice per dimensione è larga: 53,1% fra le grandi imprese, che erano al 32,5% l'anno prima, e 15,7% fra le piccole e medie, che erano al 7,7% (Istat, Imprese e ICT 2025).

Un agente lavora sui dati di un gestionale, quindi conta anche quanti gestionali ci sono. Nella stessa rilevazione un sistema ERP ce l'ha l'85,9% delle grandi imprese e il 48,8% delle PMI, un CRM il 56,5% contro il 21,1%. Su metà delle PMI italiane un agente non ha un database da interrogare, e la domanda su quale architettura scegliere arriva dopo.

05Come un agente tocca gli strumenti

Il meccanismo con cui un modello chiama uno strumento si chiama function calling: al posto del testo libero il modello emette una struttura dati con il nome della funzione e i parametri, che un programma esterno valida ed esegue. Fino al 2024 ogni integrazione era scritta su misura per la coppia modello, strumento.

Il Model Context Protocol ha spostato quel lavoro dentro a un protocollo. Anthropic lo ha pubblicato in open source il 25 novembre 2024, descrivendolo come uno standard per collegare gli assistenti ai sistemi dove stanno i dati. Sotto c'è JSON-RPC 2.0, e tre ruoli: gli host, cioè le applicazioni che aprono la connessione, i client dentro all'host, e i server che espongono le capacità. Un server offre tre cose, con questi nomi nella specifica: Resources (contesto e dati), Prompts (messaggi e flussi già scritti) e Tools (funzioni che il modello esegue). Un client può offrire Sampling, Roots ed Elicitation.

La versione corrente della specifica è la 2026-07-28. Lo schema di versione è una data nel formato anno, mese, giorno, e la data segna l'ultima volta in cui sono state introdotte modifiche che rompono la compatibilità: un aggiornamento compatibile lascia il numero fermo (modelcontextprotocol.io). Una funzione dichiarata obsoleta resta nella specifica per almeno dodici mesi prima di poter essere rimossa.

Quello che la specifica dice degli strumenti

Il capitolo su sicurezza e fiducia del Model Context Protocol scrive che gli strumenti sono esecuzione di codice arbitrario e vanno trattati con la cautela che ne consegue, che le descrizioni del comportamento di uno strumento vanno considerate non attendibili se il server non è fidato, e che l'host deve ottenere il consenso esplicito dell'utente prima di invocare uno strumento. Sono tre requisiti scritti nel documento che definisce il protocollo stesso.

06Tre rischi, con la loro fonte

La prompt injection, e il fatto che non si chiude

La voce LLM01:2025 della Top 10 OWASP per le applicazioni con modelli linguistici definisce la prompt injection come la situazione in cui i prompt in ingresso alterano il comportamento o l'uscita del modello in modi non voluti. La variante indiretta parte da una fonte esterna, un sito o un file, che il modello legge nel corso del lavoro (OWASP GenAI, LLM01:2025).

OWASP elenca sette contromisure: vincolare il comportamento del modello con istruzioni e limiti di contesto, definire e validare il formato di uscita, filtrare ingresso e uscita, applicare il privilegio minimo, chiedere l'approvazione di una persona per le operazioni ad alto rischio, separare e marcare il contenuto esterno, fare test avversariali. Il documento aggiunge una riga che vale più dell'elenco: non è chiaro che esistano metodi infallibili di prevenzione, data la natura stocastica di questi sistemi. Su un agente che manda email e scrive su un database, questo significa progettare per l'errore invece che per la sua assenza.

L'errore che esce dallo schermo

In un chatbot una risposta sbagliata resta una risposta sbagliata. In un agente diventa un'azione: un ordine emesso, un'email al destinatario sbagliato, un record modificato. Il pass^8 sotto il 25% di tau-bench misura proprio questo su compiti di servizio clienti con regole scritte, cioè nella condizione più favorevole a un agente.

Il cancello, e come lo misuro

La contromisura che costa meno è mettere un classificatore davanti agli strumenti, che decide se la pratica passa al modello o a una persona. Il classificatore che uso è Bivio, che ho scritto e pubblicato con licenza Apache-2.0 su github.com/TheRealF/bivio: legge i logit delle lettere delle opzioni invece di generare testo, gira in locale con llama.cpp e Qwen3-4B, e restituisce una confidenza su cui si mette la soglia. Sul banco di prova italiano che gli ho messo accanto, 31 casi fra ticket, clausole e voci di spesa, dà 30 risposte giuste su 31 e circa 190 ms a decisione su un M5 (misura del 22 settembre 2026, il rapporto riga per riga sta nel repository). Il numero che serve al cancello è la confidenza: senza quella la soglia si sposta dal merito della scelta alla forma della risposta.

I limiti che vanno scritti prima

Numero massimo di giri, tempo massimo, tetto di spesa in token, registro di ogni azione con i parametri, e approvazione umana per invio email, scritture su database e movimenti di denaro. Sono le stesse cose che chiedono la quinta contromisura di OWASP LLM01 e il capitolo sul consenso del Model Context Protocol.

07Cinque domande, con la misura accanto

Le cinque domande che seguono hanno ciascuna un numero di questo articolo dietro. Servono a decidere se costruire, e vengono prima di come costruire.

  1. Il percorso è lo stesso ogni volta? Se sì, un workflow deterministico ha pass^k uguale a pass^1 e si corregge una volta sola. La flessibilità dell'agente qui si paga senza incassare niente.
  2. Quante volte di fila deve riuscire? Con il pass^8 di tau-bench sotto il 25% in retail, un processo che gira venti volte al mese vuole un cancello davanti agli strumenti prima dell'autonomia piena.
  3. Quanto costa l'errore? La quinta contromisura di OWASP LLM01:2025 chiede l'approvazione di una persona per le operazioni ad alto rischio, e la specifica MCP chiede il consenso esplicito prima di invocare uno strumento. Se l'azione è irreversibile, quei due requisiti diventano il progetto.
  4. Di chi sono gli strumenti? La specifica MCP dice di trattare come non attendibili le descrizioni degli strumenti che arrivano da un server non fidato. Un agente che si collega a server di terzi eredita quel perimetro.
  5. I dati ci sono? Con l'ERP nel 48,8% delle PMI italiane e il CRM nel 21,1%, in metà dei casi la prima cosa da costruire è la fonte dati, e l'agente viene dopo.
Un agente che riesce sei volte su dieci alla prima prova riesce otto volte su otto in un quarto dei casi. Su un processo che gira tutti i giorni, il numero da guardare è il secondo.

Il percorso che regge è per gradi. Prima i processi già definiti si automatizzano in modo deterministico. Poi si mette un modello dentro a un passaggio solo, con una soglia sotto la quale la pratica esce dal flusso. L'agente completo viene alla fine, per i casi in cui il percorso cambia davvero da una pratica all'altra, e con i limiti scritti prima di accenderlo.

La misura in produzione è la stessa dei banchi di prova, applicata al proprio dominio: quota di compiti chiusi senza intervento, quota chiusa k volte di fila sullo stesso tipo di pratica, costo per pratica, tempo medio, numero di passaggi a una persona. Senza quei cinque numeri il confronto fra l'agente e il lavoro che sostituisce resta un'opinione.

In sintesi

  • ReAct alterna ragionamento e azione: 34 punti assoluti su ALFWorld e 10 su WebShop (Yao et al., 6 ottobre 2022).
  • Su tau-bench gpt-4o chiude il 61,2% dei compiti retail alla prima prova, e il pass^8 scende sotto il 25%.
  • SWE-bench è passato dall'1,96% di Claude 2 nel 2023 al 79,2% della variante Verified sulla classifica ufficiale al 29 settembre 2026.
  • MCP standardizza le chiamate agli strumenti su JSON-RPC 2.0, con versione corrente 2026-07-28, e chiede consenso esplicito prima di ogni invocazione.
  • OWASP LLM01:2025 scrive che per la prompt injection non si conoscono metodi infallibili: si progetta per l'errore.
  • In Italia usa l'AI il 16,4% delle imprese sopra i dieci addetti, ma l'ERP ce l'ha il 48,8% delle PMI (Istat, 15 dicembre 2025).

08Glossario, con la fonte accanto

I termini che ricorrono quando si parla di agenti, ognuno con il documento e la data a cui riferirsi.

Federico Boggia
L'autore

Federico Boggia

Federico Boggia è docente e formatore, founder di Binatomy. Insegna intelligenza artificiale, programmazione e pensiero computazionale per agenzie, enti e aziende, in aula e online. È laureato in Informatica Umanistica, specializzato in Tecnologie del Linguaggio, e lavora con aziende, enti e agenzie formative: formazione in azienda e progettazione di corsi finanziati. È autore di saggi e articoli su AI, dati ed etica del digitale.

Imparare facendo

Vuoi capire davvero come funzionano questi strumenti?

Tengo corsi di intelligenza artificiale e programmazione per aziende, enti e privati, anche da zero. In aula a Livorno e in Toscana, online in tutta Italia.

Scopri i corsi Prenota coaching 1:1 Iscriviti alla newsletter
Federico BoggiaRispondo io, in giornata

Ciao! Dimmi che ti serve: un corso online, un workshop di AI in aula a Livorno o la formazione per la tua azienda.

Scrivimi su WhatsApp