Articolo · Intelligenza Artificiale

Computer vision: dove arriva, e dove sbaglia

I paper che hanno spostato il campo, un banco di prova industriale e una rilevazione Istat: ogni affermazione con il suo numero.

Federico BoggiaFederico Boggia ·Intelligenza Artificiale ·Marzo 2026 ·10 min di lettura

Alla gara ImageNet del 2012 una rete convoluzionale chiuse con il 15,3% di errore top-5, contro il 26,2% del secondo classificato: 10,9 punti di scarto in una competizione che si vinceva per decimi. Da allora ogni pezzo di questo campo ha un numero pubblicato accanto, compresi i punti dove i modelli crollano al 2% di accuratezza su fotografie vere e non ritoccate. Qui ci sono quei numeri, con chi li ha misurati e quando.

01Il 15,3% del 2012, e cosa c'era sotto

Alla ImageNet Large Scale Visual Recognition Challenge del 2012 la rete di Alex Krizhevsky, Ilya Sutskever e Geoffrey Hinton chiuse con un errore top-5 del 15,3%; il secondo classificato si fermò al 26,2%. I due numeri stanno nell'abstract del paper, uno accanto all'altro (NeurIPS 2012).

La rete aveva 60 milioni di parametri e 650.000 neuroni, cinque strati convoluzionali e tre strati completamente connessi, e venne addestrata su 1,2 milioni di immagini divise in 1.000 classi. Il tempo di addestramento dichiarato: «fra cinque e sei giorni su due GTX 580 da 3 GB». Sulla versione 2010 della stessa gara gli stessi autori dichiarano 37,5% di errore top-1 e 17,0% di top-5.

Sotto quella misura c'è un compito preciso. Una fotografia da 12 megapixel in RGB, per il programma che la riceve, è una matrice di circa 36 milioni di interi fra 0 e 255. ImageNet chiede di attaccare a quella matrice una delle mille etichette previste, e conta quante volte l'etichetta giusta compare fra le cinque proposte. Tutto il resto di quello che una persona vede in una foto sta fuori dal punteggio.

Errore top-5, in due righe

Il sistema propone cinque etichette per ogni immagine. Se fra le cinque c'è quella giusta la risposta vale come corretta, altrimenti vale come errore. L'errore top-5 è la quota di immagini in cui nessuna delle cinque etichette proposte era quella giusta: al 15,3% vuol dire che su cento immagini in quindici la risposta esatta non stava nemmeno fra le cinque.

02Convoluzione, profondità, patch: tre architetture e tre soglie

Una rete convoluzionale fa scorrere sull'immagine piccoli filtri, gli stessi in ogni punto. Da quello vengono due proprietà misurabili: i parametri di un filtro si riusano su tutta la superficie, quindi la rete ne ha molti meno di una completamente connessa, e un oggetto spostato di venti pixel attiva lo stesso filtro venti pixel più in là. Le cinque convoluzioni di AlexNet stanno lì.

Profondità: da 8 strati a 152

Kaiming He, Xiangyu Zhang, Shaoqing Ren e Jian Sun hanno depositato il 10 dicembre 2015 una rete profonda 152 strati, «8 volte più profonda di VGG e con una complessità più bassa», che in configurazione a più modelli chiude con il 3,57% di errore top-5 sul test ImageNet e vince l'edizione 2015 della gara (arXiv:1512.03385). Il contributo tecnico è la connessione che salta due strati e somma l'ingresso all'uscita: senza, le reti oltre una certa profondità peggioravano invece di migliorare.

Quel 3,57% viene spesso raccontato come il sorpasso sull'occhio umano, e il confronto esiste davvero. Olga Russakovsky e colleghi hanno fatto etichettare 1.500 immagini del test a un annotatore addestrato per l'occasione: errore 5,1%, contro il 6,8% di GoogLeNet sullo stesso campione (arXiv:1409.0575). Il confronto regge dentro quel recinto: un annotatore solo, 1.500 immagini, mille etichette fissate in anticipo. Fuori da quel recinto non dice niente su chi veda meglio.

Patch: quando l'architettura vince solo con i dati

Il 22 ottobre 2020 Alexey Dosovitskiy e colleghi hanno tagliato l'immagine in quadrati di 16×16 pixel e li hanno dati in pasto a un transformer, la stessa architettura usata per il testo (arXiv:2010.11929). Il paper dichiara anche il limite: i transformer «non generalizzano bene quando sono addestrati su quantità di dati insufficienti», perché a differenza delle convoluzioni non sanno in partenza che un oggetto spostato resta lo stesso oggetto.

La soglia è misurata. Con 9 milioni di esempi di pre-addestramento ViT-L/16 sta sotto una ResNet152x2; il sorpasso arriva oltre i 90 milioni; con i 303 milioni di JFT-300M, ViT-H/14 chiude all'88,55% di accuratezza top-1 su ImageNet. Il corpus intermedio, ImageNet-21k, ne ha 14 milioni. Chi ha meno di cento milioni di immagini etichettate sceglie l'architettura vecchia e ha ragione.

In sintesi

  • 2012, AlexNet: errore top-5 del 15,3% contro il 26,2% del secondo, con 60 milioni di parametri e sei giorni su due GPU.
  • 2015, ResNet: 152 strati e 3,57% di errore top-5, sotto il 5,1% dell'annotatore umano misurato su 1.500 immagini.
  • 2020, Vision Transformer: 88,55% su ImageNet, dopo un pre-addestramento su 303 milioni di esempi.
  • Sotto i 90 milioni di esempi le reti convoluzionali restano davanti.

03Beni culturali: il papiro di Ercolano letto senza aprirlo

Il 5 febbraio 2024 il Vesuvius Challenge ha assegnato il primo premio, 700.000 dollari, a Youssef Nader, Luke Farritor e Julian Schilliger. Il risultato: 15 colonne di testo e oltre 2.000 caratteri recuperati da un rotolo di Ercolano carbonizzato, circa il 5% del primo rotolo, senza aprirlo (scrollprize.org). Per vincere bastava molto meno: quattro passaggi da 140 caratteri con almeno l'85% dei caratteri leggibili.

La catena ha tre passaggi, e la visione artificiale sta nel terzo. Il rotolo viene scansionato con tomografia a raggi X al sincrotrone Diamond Light Source, vicino a Oxford; i fogli arrotolati vengono seguiti e distesi con Volume Cartographer; sui fogli distesi un modello basato su TimeSformer segna dove c'è inchiostro. Il testo che ne esce è di filosofia epicurea, attribuito a Filodemo, e parla di piacere e di cibo.

PassaggioStrumentoCosa produce
ScansioneTomografia a raggi X al sincrotroneUn volume tridimensionale del rotolo chiuso
SegmentazioneVolume Cartographer, con lavoro umanoI fogli seguiti uno per uno e distesi su un piano
Rilevamento dell'inchiostroModello TimeSformer addestrato su frammenti già leggibiliLe lettere, dove il modello segnala inchiostro

Quel 5% dice anche cosa manca. Seguire i fogli uno per uno resta lavoro umano assistito, e la scansione richiede un acceleratore di particelle. Un risultato del genere non si trasferisce a un archivio comunale cambiando modello.

04Controllo qualità: il banco di prova MVTec AD e il 99,6%

L'ispezione visiva industriale ha un banco di prova pubblico dal 2019. Paul Bergmann, Michael Fauser, David Sattlegger e Carsten Steger, di MVTec Software, hanno pubblicato a CVPR 2019 il dataset MVTec AD: 5.354 immagini ad alta risoluzione, 15 categorie fra cui cinque tessiture (tappeto, griglia, pelle, piastrella, legno) e dieci oggetti, oltre 70 tipi di difetto, con le aree difettose marcate pixel per pixel (paper CVPR).

La struttura del dataset copia il problema di una fabbrica. Le 3.629 immagini di addestramento sono tutte senza difetti, perché una linea nuova i suoi difetti non li ha ancora visti e non può etichettarli; le 1.725 immagini di prova contengono sia pezzi buoni sia pezzi rotti. Il lato dell'immagine sta fra 700 e 1.024 pixel. Nel 2019 gli autori concludevano che restava «considerevole spazio di miglioramento».

Due anni dopo quel margine era quasi tutto consumato. Karsten Roth e colleghi hanno pubblicato il 15 giugno 2021 PatchCore, che su MVTec AD arriva a un AUROC del 99,6% a livello di immagine, «più che dimezzando l'errore rispetto al migliore dei concorrenti» (arXiv:2106.08265).

Nota

L'AUROC misura quanto i punteggi dei pezzi buoni si separano da quelli dei pezzi difettosi, su tutte le soglie possibili. La soglia vera la sceglie chi installa l'impianto, e da quella scelta escono i due numeri che pesano in produzione: quanti pezzi rotti passano e quanti pezzi buoni vengono scartati. Un 99,6% di AUROC non dice quale dei due si paga.

Restano due vincoli scritti. MVTec AD ha 15 categorie fotografate con illuminazione fissa, mentre una linea vera cambia lotto, luce e sporco. E la licenza del dataset è CC BY-NC-SA 4.0, cioè vieta l'uso commerciale: chi ci addestra un prodotto da vendere sta fuori dalla licenza.

05Riconoscere un luogo: 5 milioni di foto, 200.000 monumenti

Riconoscere un monumento in una fotografia è un compito diverso dal riconoscere un gatto, e la differenza ha un nome: riconoscimento a livello di istanza. L'etichetta utile dice quale chiesa. La categoria «chiesa» lascia fuori tutto il lavoro. Il banco di prova pubblico lo hanno costruito Tobias Weyand, Andre Araujo, Bingyi Cao e Jack Sim il 3 aprile 2020: Google Landmarks Dataset v2, oltre 5 milioni di immagini da Wikimedia Commons e 200.000 etichette distinte, con un insieme di prova da 118.000 immagini e oltre 800 ore di annotazione umana (arXiv:2004.01804).

Gli autori dichiarano tre proprietà scelte apposta perché il banco somigli all'uso vero. La distribuzione delle classi ha una coda lunghissima, quindi la maggior parte dei 200.000 luoghi ha pochissime foto. Gran parte delle immagini di prova è fuori dominio, cioè non ritrae nessun monumento, perché è quello che succede a un servizio a cui la gente manda fotografie qualsiasi. E la variabilità dentro la stessa classe è alta: stagione, ora del giorno, ponteggi, angolo di ripresa.

Da qui si capisce perché il Colosseo funziona sempre e la pieve romanica di un paese no. Non cambia il modello, cambia quante fotografie di quel luogo esistono online. Per una guida turistica che copre un territorio, il lavoro sta nel costruire le immagini di riferimento dei luoghi che nella coda lunga ci stanno.

06Dove sbaglia in modo sistematico

Fotografie vere, accuratezza al 2%

Dan Hendrycks, Kevin Zhao, Steven Basart, Jacob Steinhardt e Dawn Song hanno raccolto ImageNet-A: 7.500 fotografie reali e non modificate, di 200 classi già presenti in ImageNet, tenute solo se un ResNet-50 le sbagliava (arXiv:1907.07174). Su quelle immagini una DenseNet-121 ottiene «circa il 2% di accuratezza, un calo di circa il 90%», e un ResNet-50 addestrato da zero si ferma al 2,17%. Sulle stesse 200 classi, con immagini ImageNet normali, l'accuratezza supera il 90%.

Nessuna di quelle immagini è ritoccata. Il crollo viene dal cambio di distribuzione: sfondi insoliti, oggetti in ombra, inquadrature che nel corpus di addestramento non c'erano. È il guasto che si presenta quando un sistema collaudato in laboratorio finisce in un capannone con un'altra luce.

Adesivi su un cartello di stop

Kevin Eykholt e colleghi hanno attaccato adesivi bianchi e neri su un cartello di stop vero, il 27 luglio 2017. Risultato dichiarato: classificazione errata e mirata, cioè verso l'etichetta scelta dall'attaccante, nel 100% delle immagini scattate in laboratorio da posizione fissa e nell'84,8% dei fotogrammi ripresi da un veicolo in movimento (arXiv:1707.08945). L'attacco costa qualche euro di carta adesiva e sopravvive al passaggio dal mondo fisico alla telecamera.

Il testo dentro l'immagine

CLIP arriva al 76,2% su ImageNet senza avere mai visto le immagini di addestramento di quel banco, e sulle cifre scritte a mano di MNIST si ferma all'88%, sotto «una linea di base imbarazzantemente semplice come una regressione logistica sui pixel grezzi». Lo scrivono gli autori nel loro stesso paper (arXiv:2103.00020). Riconoscere una scena e leggere i caratteri che ci stanno dentro sono due capacità separate, e la seconda non arriva in regalo con la prima.

I limiti che dichiara chi vende

La documentazione di Anthropic sulle immagini, letta il 29 settembre 2026, elenca cosa il modello non fa bene: i conteggi sono approssimativi, «soprattutto con molti oggetti piccoli»; le coordinate e la localizzazione sono approssimative; su immagini sotto i 200 pixel, ruotate o di bassa qualità il modello può sbagliare; e stabilire se un'immagine è generata da AI resta fuori dalla sua portata (documentazione Anthropic). Sono limiti scritti dal fornitore nella pagina che spiega come usare il prodotto.

07Cosa è cambiato dal 2021: un modello, nessun addestramento

Il 26 febbraio 2021 Alec Radford e colleghi hanno pubblicato CLIP, addestrato su 400 milioni di coppie immagine-testo a dire quale didascalia va con quale immagine. Quel modello arriva al 76,2% di accuratezza top-1 su ImageNet «senza usare nessuno degli 1,28 milioni di esempi di addestramento» su cui era stata addestrata la ResNet-50 con cui viene confrontato.

Il cambiamento pratico sta nel come si dichiara un'etichetta. Prima di CLIP, aggiungere una categoria voleva dire raccogliere immagini, etichettarle e riaddestrare; dopo, si scrive la categoria a parole. Nella segmentazione è successo lo stesso con Segment Anything, pubblicato da Alexander Kirillov e colleghi il 5 aprile 2023: 11 milioni di immagini e oltre un miliardo di maschere, con prestazioni zero-shot «spesso competitive o superiori a risultati ottenuti con piena supervisione» (arXiv:2304.02643).

Il pezzo che resta a chi installa è sempre lo stesso, e MVTec AD ne è la misura: cinquemila immagini dei propri pezzi, dei propri difetti, con la propria luce. Un modello addestrato su 400 milioni di coppie prese dal web non ha mai visto la crepa che si forma sul vostro smalto. La parte multimodale di questa storia, cioè cosa succede quando testo e immagini entrano nello stesso modello, sta in IA multimodale: come un modello legge un'immagine.

08Quanto se ne usa in Italia: il conto vero

Istat pubblica il dato il 15 dicembre 2025. Il 16,4% delle imprese italiane con almeno dieci addetti usa almeno una tecnologia di intelligenza artificiale, contro l'8,2% del 2024 e il 5,0% del 2023. Fra le imprese che l'AI la usano, le tecnologie più diffuse sono l'estrazione di informazione da documenti di testo (70,8%), l'AI generativa (59,1%) e il riconoscimento vocale (41,3%); il riconoscimento delle immagini si ferma a circa il 18%, insieme all'automazione dei flussi di lavoro (Istat, Imprese e ICT 2025).

Moltiplicando le due quote si ottiene il numero che conta: la visione artificiale è installata in circa tre imprese su cento fra quelle con almeno dieci addetti. Il 99,6% di AUROC su MVTec AD è del 2021, il tre per cento è del 2025. In mezzo ci sono le telecamere, l'illuminazione, le immagini di riferimento dei propri pezzi e qualcuno che sappia scegliere la soglia.

In sintesi

  • Il salto del 2012 vale 10,9 punti: 15,3% di errore top-5 contro il 26,2% del secondo classificato.
  • Il 3,57% di ResNet nel 2015 sta sotto il 5,1% di un annotatore umano, misurato però su 1.500 immagini e mille etichette fissate.
  • I Vision Transformer superano le convoluzioni solo oltre i 90 milioni di esempi di pre-addestramento.
  • Su MVTec AD si arriva al 99,6% di AUROC addestrando solo su pezzi buoni; la soglia di scarto resta una scelta umana.
  • Su 7.500 fotografie vere di ImageNet-A i classificatori standard scendono al 2% di accuratezza.
  • In Italia il riconoscimento di immagini arriva a circa tre imprese su cento con almeno dieci addetti (Istat, dicembre 2025).
Federico Boggia
L'autore

Federico Boggia

Federico Boggia è docente e formatore, founder di Binatomy. Insegna intelligenza artificiale, programmazione e pensiero computazionale per agenzie, enti e aziende, in aula e online. È laureato in Informatica Umanistica, specializzato in Tecnologie del Linguaggio, e lavora con aziende, enti e agenzie formative: formazione in azienda e progettazione di corsi finanziati. È autore di saggi e articoli su AI, dati ed etica del digitale.

Imparare facendo

Vuoi capire davvero come funzionano questi strumenti?

Tengo corsi di intelligenza artificiale e programmazione per aziende, enti e privati, anche da zero. In aula a Livorno e in Toscana, online in tutta Italia.

Scopri i corsi Prenota coaching 1:1 Iscriviti alla newsletter
Federico BoggiaRispondo io, in giornata

Ciao! Dimmi che ti serve: un corso online, un workshop di AI in aula a Livorno o la formazione per la tua azienda.

Scrivimi su WhatsApp