Articolo · Intelligenza Artificiale

IA multimodale: come un modello
legge un'immagine

Il conto dei token, i banchi di prova con i punteggi, e i sette compiti da bambini su cui i modelli si fermano al 58%.

Federico BoggiaFederico Boggia ·Intelligenza Artificiale ·Marzo 2026 ·9 min di lettura

Una fotografia da 1000×1000 pixel, mandata a Claude, costa 1.296 token: l'immagine viene divisa in quadrati di 28 pixel per 28 e ogni quadrato pesa come una parola. Il numero sta nella documentazione di Anthropic, letta il 29 settembre 2026. Da quel conto si capisce che cosa sia un modello multimodale, quanto costa usarlo e perché su certi compiti semplici sbaglia in modo sistematico.

01Testo e immagini nello stesso spazio: 400 milioni di coppie

Il 26 febbraio 2021 Alec Radford e colleghi hanno pubblicato CLIP, addestrato su 400 milioni di coppie immagine-testo raccolte dal web con un compito solo: dire quale didascalia va con quale immagine. Il modello che ne esce classifica ImageNet al 76,2% di accuratezza top-1 «senza usare nessuno degli 1,28 milioni di esempi di addestramento» della ResNet-50 con cui viene confrontato (arXiv:2103.00020).

Quel numero dice una cosa precisa sul significato della parola multimodale. Le didascalie non erano etichette scelte da chi addestrava: erano testo scritto da esseri umani accanto a una foto, per altri motivi. Il modello ha imparato a mettere la foto e la sua frase vicine dentro lo stesso spazio numerico, e da lì a scegliere fra mille categorie scritte a parole.

Definizione

Un modello è multimodale quando riceve più di un tipo di dato nella stessa richiesta e li tratta come oggetti dello stesso genere, cioè sequenze di vettori. Una catena in cui un programma descrive l'immagine a parole e passa la descrizione a un secondo programma fa un'altra cosa: lì il secondo pezzo legge un testo, e dell'immagine ha solo quello che il primo ha scelto di scrivere.

02Da CLIP a Flamingo: come i due pezzi sono stati attaccati

L'idea che ha reso possibile l'aggancio arriva dal Vision Transformer, depositato da Alexey Dosovitskiy e colleghi il 22 ottobre 2020: l'immagine viene tagliata in quadrati di 16×16 pixel e la sequenza di quadrati entra nella stessa architettura usata per le parole (arXiv:2010.11929). Da quel momento un'immagine e una frase hanno la stessa forma: una sequenza di vettori.

Il passo successivo è del 29 aprile 2022. Jean-Baptiste Alayrac e colleghi pubblicano Flamingo, costruito attaccando due modelli già addestrati invece di addestrarne uno nuovo: l'encoder visivo e il modello di linguaggio restano congelati, un modulo chiamato Perceiver Resampler riduce un numero variabile di caratteristiche visive a 64 uscite fisse, e fra gli strati esistenti del modello linguistico vengono inseriti strati di cross-attention nuovi, «con una porta, così che il modello di linguaggio resti intatto all'inizializzazione» (arXiv:2204.14198).

Oggi quel cucito sta dentro l'interfaccia. Nelle API di Anthropic un'immagine è un blocco di contenuto accanto al testo, e tutti i modelli Claude in listino accettano immagini in ingresso (documentazione letta il 29 settembre 2026). La stessa pagina consiglia di mettere l'immagine prima del testo, perché il modello lavora meglio così.

SistemaCosa resta congelatoCome si attaccano i due lati
CLIP, febbraio 2021Niente, i due encoder si addestrano insiemeAddestramento contrastivo su 400 milioni di coppie: la coppia giusta si avvicina, le altre si allontanano
Flamingo, aprile 2022Encoder visivo e modello di linguaggioPerceiver Resampler a 64 uscite più strati di cross-attention con porta, inseriti fra gli strati esistenti
API di oggiDal punto di vista di chi scrive il codice, tuttoL'immagine è un blocco di contenuto nel messaggio, e costa token come il testo

03Un'immagine costa token, e il conto è esatto

La documentazione di Anthropic scrive la formula. Claude guarda l'immagine a quadrati di 28×28 pixel, e ogni quadrato è un token visivo: il costo di un'immagine larga w e alta h pixel è il prodotto di w diviso 28 e h diviso 28, arrotondati per eccesso (documentazione Anthropic, letta il 29 settembre 2026).

Dalla formula escono i numeri della tabella pubblicata sulla stessa pagina. Una fotografia da 1000×1000 pixel costa 1.296 token visivi; una da 1920×1080 ne costa 1.560 sul livello standard, dove viene prima rimpicciolita a 1456×819, e 2.691 sul livello ad alta risoluzione; un'immagine 4K arriva a 4.784 sul livello alto, che è il tetto. I due tetti dichiarati: lato lungo 2.576 pixel e 4.784 token visivi sui modelli dalla versione 4.7 in poi, 1.568 pixel e 1.568 token su tutti gli altri.

Perché la spesa cresce in fretta

Il costo dipende dall'area, quindi raddoppiare il lato di un'immagine moltiplica per quattro i token. La documentazione fa il conto in dollari: a 1 dollaro per milione di token in ingresso, mille immagini da 1000×1000 costano circa 1,30 dollari; a 5 dollari per milione sul livello ad alta risoluzione le stesse mille immagini costano circa 6,48 dollari, e mille immagini 4K circa 23,92. Sono cifre del 29 settembre 2026 e seguono il listino.

Gli altri vincoli scritti servono a dimensionare un lavoro prima di cominciarlo. I formati accettati sono JPEG, PNG, GIF e WebP, delle animazioni viene letto solo il primo fotogramma, il peso massimo è 10 MB per immagine sull'API diretta e le dimensioni massime sono 8000×8000 pixel. Per richiesta si arriva a 100 immagini sui modelli con finestra da 200.000 token e a 600 sugli altri, con un limite più stretto sulle dimensioni quando in una richiesta ce ne sono più di venti.

Il dettaglio che cambia i conti di un progetto sta nella compressione. La stessa pagina avverte che comprimere molto in JPEG riduce la latenza ma introduce artefatti «che possono rendere il testo difficile da leggere»: su un archivio di documenti fotografati, la compressione decisa per risparmiare banda si paga in campi estratti male.

04Cosa dicono i banchi di prova: documenti e domande d'esame

Il caso d'uso più diffuso è leggere un documento fotografato o scansionato. Il banco di prova pubblico si chiama DocVQA, pubblicato da Minesh Mathew, Dimosthenis Karatzas e C. V. Jawahar il 1° luglio 2020: 50.000 domande su oltre 12.000 immagini di documenti, con una prestazione umana dichiarata del 94,36% (arXiv:2007.00398). Gli autori indicano dove i modelli dell'epoca cadevano: le domande in cui bisogna capire la struttura del documento, cioè tabelle, moduli e colonne.

Quel 94,36% è un dato utile a chi progetta. Sui documenti veri neppure una persona arriva a cento, perché il documento è sbiadito, scritto a mano o ambiguo. Una soglia di accettazione fissata al 99% su un'estrazione automatica chiede alla macchina più di quanto chieda l'ufficio accanto.

MMMU, e quanto di quel punteggio era gratis

Per i compiti che richiedono di guardare e ragionare insieme, il banco più citato è MMMU, pubblicato da Xiang Yue e colleghi il 27 novembre 2023: 11.550 domande da corsi universitari, sei discipline, 30 materie, 183 sottocampi e 30 tipi di immagine, fra cui grafici, mappe, spartiti e strutture chimiche. I punteggi dichiarati nell'abstract: GPT-4V al 56%, Gemini Ultra al 59% (arXiv:2311.16502).

A settembre 2024 gli stessi autori hanno pubblicato MMMU-Pro, costruito in tre mosse: via le domande a cui rispondeva un modello di solo testo, più opzioni fra cui scegliere, e una modalità in cui la domanda è scritta dentro l'immagine. Il calo dei punteggi va dal 16,8% al 26,9% a seconda del modello (arXiv:2409.02813). Una fetta di quello che sembrava capacità di leggere figure era memoria del testo delle domande.

In sintesi

  • CLIP, 2021: 400 milioni di coppie immagine-testo, 76,2% su ImageNet senza addestramento su quel banco.
  • Flamingo, 2022: encoder visivo e modello linguistico congelati, agganciati con cross-attention a porta.
  • Un'immagine costa token per area: 1.296 per 1000×1000 pixel, con un tetto a 4.784.
  • Sui documenti la prestazione umana dichiarata su DocVQA è 94,36%, non 100%.
  • Togliendo da MMMU le domande risolvibili senza immagine, i punteggi calano da 16,8 a 26,9 punti.

05Generare costa poco, riconoscere il generato non funziona

Sul lato della generazione il passaggio tecnico ha una data: 20 dicembre 2021, quando Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser e Björn Ommer hanno spostato la diffusione dallo spazio dei pixel allo spazio latente di un autoencoder, agganciando il testo con strati di cross-attention (arXiv:2112.10752). Il risultato dichiarato dagli autori è l'addestramento «su risorse di calcolo limitate» al posto delle centinaia di giorni-GPU che serviva prima. Da lì vengono i generatori di immagini che girano su una scheda grafica da gioco.

Il rovescio sta scritto nella documentazione di chi vende il modello che quelle immagini dovrebbe riconoscerle. Anthropic dichiara che Claude «non può stabilire se un'immagine è generata da AI e può sbagliare se glielo si chiede», e aggiunge di non usarlo per individuare immagini false o sintetiche (letta il 29 settembre 2026). La stessa pagina chiarisce che Claude le immagini le legge e non le produce.

La conseguenza pratica per chi lavora è una sola: la marcatura va messa in partenza, da chi genera, perché a valle non c'è uno strumento che la ricostruisca. Un ufficio che pubblica immagini sintetiche tiene traccia di quali sono nel momento in cui le crea, con il file e la voce di registro, e non conta di riconoscerle dopo.

06Sette compiti da bambini, e il 58,07%

Il 9 luglio 2024 Pooyan Rahmanzadehgervi, Logan Bolton, Mohammad Reza Taesiri e Anh Totti Nguyen hanno messo quattro modelli allo stato dell'arte davanti a sette compiti elementari: dire se due cerchi si sovrappongono, contare quante volte si incrociano due linee, dire quale lettera è cerchiata in una parola, contare i cerchi di un logo tipo olimpico. La media dei quattro è 58,07%; il migliore, Claude 3.5 Sonnet, arriva al 77,84%, contro il 100% che ci si aspetta da una persona (arXiv:2407.06581).

Il pezzo interessante del paper è la diagnosi. Allontanando fra loro le figure, l'accuratezza torna vicina al 100%: il guasto salta fuori quando le forme si sovrappongono o si toccano. E gli esperimenti di sondaggio lineare dicono che l'informazione visiva nell'encoder c'è tutta; a non decodificarla è il modello di linguaggio.

Gli stessi limiti compaiono nella pagina che spiega come usare il prodotto. Anthropic scrive che i conteggi sono approssimativi «soprattutto con molti oggetti piccoli», che coordinate e localizzazione sono approssimative, che su immagini sotto i 200 pixel, ruotate o di bassa qualità il modello può sbagliare, e che le scansioni diagnostiche complesse come TAC e risonanze stanno fuori dall'uso previsto.

Nota

Le tre cose che cadono sono sempre le stesse: contare, posizionare, distinguere figure che si toccano. Una catena di lavoro che chieda a un modello multimodale di contare i pezzi su un bancale o di dire dove sta un difetto in millimetri sta chiedendo esattamente quello che la misura dice che sbaglia. Quei due compiti hanno strumenti dedicati, e la parte di lettura e di giudizio resta al modello.

07Cosa resta quando cambia il modello

Tre cose di questo articolo non dipendono da quale modello sarà in listino fra un anno.

La prima è il conto dei token per area, che è una proprietà di come l'immagine entra: finché si taglia in quadrati, la spesa cresce col quadrato del lato, e chi manda scansioni a piena risoluzione paga quattro volte chi le manda dimezzate. La seconda è che i banchi di prova invecchiano in fretta: MMMU è del novembre 2023, undici mesi dopo ne è servita una versione più dura, e i punteggi citati qui valgono per i modelli di allora. Chi sceglie un modello oggi misura sul proprio compito, con le proprie immagini, e tiene il risultato come metro per il prossimo.

La terza è la separazione fra quello che il modello legge e quello che decide qualcun altro. Un numero estratto da una fattura fotografata è una lettura, e finisce in contabilità: fra le due cose ci va una verifica, tanto più stretta quanto più costa l'errore. La parte che riguarda le immagini da sole, cioè classificazione, difetti e riconoscimento di luoghi, sta in Computer vision: dove arriva, e dove sbaglia.

In sintesi

  • Multimodale significa un modello solo che riceve testo e immagini come sequenze dello stesso tipo.
  • Il conto dei token si fa sull'area: 28×28 pixel per token visivo, tetto a 4.784 sui modelli recenti.
  • Su MMMU-Pro i punteggi calano fino a 26,9 punti rispetto a MMMU, perché una parte era risolvibile senza guardare.
  • Su sette compiti geometrici elementari quattro modelli di punta stanno al 58,07% di media.
  • Generare immagini costa poco dal 2021; riconoscere se un'immagine è generata resta fuori dalle capacità dichiarate.
Federico Boggia
L'autore

Federico Boggia

Federico Boggia è docente e formatore, founder di Binatomy. Insegna intelligenza artificiale, programmazione e pensiero computazionale per agenzie, enti e aziende, in aula e online. È laureato in Informatica Umanistica, specializzato in Tecnologie del Linguaggio, e lavora con aziende, enti e agenzie formative: formazione in azienda e progettazione di corsi finanziati. È autore di saggi e articoli su AI, dati ed etica del digitale.

Imparare facendo

Vuoi capire davvero come funzionano questi strumenti?

Tengo corsi di intelligenza artificiale e programmazione per aziende, enti e privati, anche da zero. In aula a Livorno e in Toscana, online in tutta Italia.

Scopri i corsi Prenota coaching 1:1 Iscriviti alla newsletter
Federico BoggiaRispondo io, in giornata

Ciao! Dimmi che ti serve: un corso online, un workshop di AI in aula a Livorno o la formazione per la tua azienda.

Scrivimi su WhatsApp