Articolo · Intelligenza Artificiale

Embedding semantici:
cosa misurano davvero

Nove fonti primarie, dal banco di prova del 2013 alla documentazione di oggi, con il punteggio accanto a ogni affermazione.

Federico BoggiaFederico Boggia ·Intelligenza Artificiale ·Marzo 2026 ·9 min di lettura

Nel 2013 quattro ricercatori di Google pubblicano un banco di prova da 19.544 domande di analogia e un modello che ne indovina il 53,3%. Un anno e mezzo dopo GloVe arriva al 75,0%. Quei due numeri dicono quanto significato entra davvero in una lista di numeri. L'esempio che tutti citano, «re meno uomo più donna dà regina», regge invece anche per una ragione di codice: l'implementazione standard vieta di restituire una delle tre parole della domanda.

01Da one-hot a Word2Vec: 19.544 domande di prova

Un modello di linguaggio lavora su numeri. Il primo modo di darglieli, il one-hot encoding, assegna a ogni parola del vocabolario una posizione e la scrive come una lista di zeri con un solo 1. Con centomila parole servono centomila caselle per parola, e in quello spazio la distanza fra «cane» e «gatto» è identica alla distanza fra «cane» e «frigorifero»: nessuna relazione di significato entra nella codifica.

L'ipotesi distribuzionale, formulata negli anni Cinquanta

Parole che compaiono in contesti simili hanno significati simili. Daniel Jurafsky e James H. Martin fanno risalire questa ipotesi distribuzionale a Martin Joos (1950), Zellig Harris (1954) e John Rupert Firth (1957), che avevano notato come due sinonimi, per esempio oculist e eye-doctor, tendano a comparire vicino alle stesse parole (Speech and Language Processing, bozza del 19 agosto 2026, capitolo 5). La formulazione di Harris è già quantitativa.

corresponding roughly to the amount of difference in their environments

Zellig Harris, 1954, p. 157, citato in Jurafsky e Martin

La quantità di differenza di significato fra due parole corrisponde all'incirca alla quantità di differenza fra i loro ambienti. Nel 2013 quella frase è diventata una procedura: si contano i contesti, si comprimono in un vettore, si misura la distanza.

Word2Vec, gennaio 2013

Tomas Mikolov, Kai Chen, Greg Corrado e Jeffrey Dean depositano Efficient Estimation of Word Representations in Vector Space il 16 gennaio 2013 (arXiv:1301.3781). Due architetture, CBOW e skip-gram, addestrate a un compito accessorio: prevedere le parole attorno a una parola, o la parola al centro di un contesto. Del compito non resta niente; restano i pesi che la rete ha imparato per ogni parola, che sono gli embedding.

Nello stesso paper c'è il banco di prova su cui la disciplina si misura da allora: 19.544 domande di analogia nella forma «a sta a b come c sta a ?», divise in 8.869 semantiche su 5 categorie e 10.675 sintattiche su 9. Le categorie semantiche sono capitali, valute, città e stato, maschile e femminile; quelle sintattiche sono comparativi, superlativi, plurali, tempi verbali e simili.

ModelloDimensioniParole di addestramentoSemanticheSintatticheTotale
CBOW (Mikolov et al., 2013)300783 milioni15,5%53,1%36,1%
Skip-gram (Mikolov et al., 2013)300783 milioni50,0%55,9%53,3%
GloVe (Pennington et al., 2014)30042 miliardi81,9%69,3%75,0%

Il salto fra il 36,1% del CBOW e il 53,3% dello skip-gram sta dentro lo stesso paper, a parità di dimensioni e di corpus: cambia solo la direzione della previsione. Il 75,0% di GloVe arriva un anno e mezzo dopo (Jeffrey Pennington, Richard Socher e Christopher D. Manning, EMNLP 2014, Doha, pp. 1532‑1543, D14‑1162) con un corpus 54 volte più grande e un metodo diverso: una regressione log-bilineare sui conteggi globali di co-occorrenza, invece delle finestre di contesto locali.

Nell'ottobre 2013 gli stessi autori, con Ilya Sutskever, pubblicano il seguito (arXiv:1310.4546). Il campionamento negativo e il sottocampionamento delle parole frequenti portano un addestramento da 38 a 14 minuti alzando la precisione dal 59% al 60%, e su un banco di analogie fra locuzioni il modello migliore, addestrato su 33 miliardi di parole, arriva al 72%.

In sintesi

  • L'one-hot encoding dà a ogni parola un numero e nessuna relazione: «cane» dista da «gatto» quanto da «frigorifero».
  • L'ipotesi distribuzionale è del 1950-1957 e dice che il significato sta nei contesti d'uso.
  • Il banco di prova del 2013 ha 19.544 analogie, 8.869 semantiche e 10.675 sintattiche.
  • Skip-gram indovina il 53,3% del totale a 300 dimensioni; GloVe il 75,0% con 42 miliardi di token.

02Quante dimensioni, e cosa ci sta dentro

Un vettore è una lista ordinata di numeri. Su una mappa bastano due coordinate per individuare una città e misurare le distanze; un embedding fa la stessa operazione su centinaia o migliaia di coordinate. Word2Vec e GloVe ne usano 300, e i modelli di oggi molte di più.

Le misure dei modelli di settembre 2026

Il modello di embedding di Google, letto il 29 settembre 2026, si chiama gemini-embedding-2: esce con 3.072 numeri per default, accetta qualunque taglia fra 128 e 3.072 (consigliate 768, 1.536 e 3.072) e legge al massimo 8.192 token per volta (documentazione Gemini API). Lo stesso giorno, voyage-4-large di Voyage AI esce con 1.024 numeri per default, con 256, 512 e 2.048 come alternative, e legge 32.000 token (documentazione Voyage). Sono cifre che cambiano a ogni versione: qui valgono con quella data attaccata.

Le taglie variabili vengono dalla Matryoshka Representation Learning, dichiarata da Google per entrambi i suoi modelli: la rete impara vettori in cui anche il solo prefisso funziona, così tagliare le ultime coordinate costa precisione e lascia il vettore utilizzabile.

Quanto pesa un archivio di vettori

Un milione di documenti a 3.072 numeri in virgola mobile da 4 byte occupa circa 12,3 GB di soli vettori. La stessa collezione tagliata a 256 numeri ne occupa 1,0 GB. È il conto che rende utile la Matryoshka, e il primo che conviene fare prima di scegliere una dimensione.

La distanza, e la formula dell'analogia

La misura usata è la similarità del coseno, cioè l'angolo fra due vettori. Il paper di GloVe scrive per esteso anche la procedura dell'analogia: alla domanda «a sta a b come c sta a ?» si risponde cercando la parola d il cui vettore è più vicino a wb − wa + wc secondo la similarità del coseno, e conta come corretta solo la corrispondenza esatta. Da qui viene l'esempio che gira dal 2013, «re meno uomo più donna dà regina», che nella sezione 05 va guardato da vicino.

Cosa significa la coordinata numero 47

La risposta onesta è che non si sa. Le dimensioni non corrispondono a tratti decisi da qualcuno: sono direzioni che il modello ha trovato da sé minimizzando un errore di previsione. Alcune sembrano allineate a qualcosa di riconoscibile, un asse maschile-femminile o singolare-plurale, e la maggior parte resta una combinazione che funziona per il calcolo e non si lascia leggere.

03Polisemia, e gli embedding contestuali

In Word2Vec e in GloVe ogni parola ha un vettore solo, sempre lo stesso. «Pesca» in «vado a pesca al lago» e «pesca» in «mangio una pesca matura» ricevono la stessa lista di numeri, che finisce per essere la media di due significati senza rapporto. Lo stesso vale per «piano», «calcio», «riso». Con un vettore per parola la polisemia si perde per costruzione.

Dal 2017 la stessa parola cambia vettore

L'architettura Transformer (Vaswani et al., 12 giugno 2017, arXiv:1706.03762) calcola per ogni token un vettore che dipende dagli altri token della frase: sono gli embedding contestuali. La stessa sequenza di lettere riceve vettori diversi in frasi diverse, e i due sensi di «pesca» finiscono in due regioni distinte. Il meccanismo che lo permette è la self-attention, descritta nell'articolo su come funziona l'attention.

Il primo modello a mostrare quanto valesse la differenza è BERT: Jacob Devlin, Ming-Wei Chang, Kenton Lee e Kristina Toutanova, 11 ottobre 2018 (arXiv:1810.04805). I numeri dichiarati nell'abstract: 80,5% su GLUE con 7,7 punti di guadagno, 86,7% su MultiNLI con 4,6 punti, F1 93,2 su SQuAD 1.1 e 83,1 su SQuAD 2.0.

Da lì in poi un embedding non è più di una parola: è di un pezzo di testo intero, una frase, un paragrafo, una pagina. I modelli citati nella sezione 02 leggono fra 8.192 e 32.000 token per volta e restituiscono un vettore solo per tutto il blocco.

04Dove si usano, e come si misurano

La mappa di quello che si fa con gli embedding è il MTEB, il banco di prova di Niklas Muennighoff, Nouamane Tazi, Loïc Magne e Nils Reimers, depositato il 13 ottobre 2022 (arXiv:2210.07316): 8 famiglie di compiti, 58 insiemi di dati, 112 lingue e 33 modelli confrontati alla pubblicazione.

Tutte queste applicazioni poggiano su un archivio che conserva i vettori e sa trovare in fretta i più vicini a una richiesta: un vector database. La sua dimensione si calcola col conto della sezione 02, e cresce linearmente con il numero di dimensioni scelte.

05Quattro limiti misurati

1. I pregiudizi nei dati arrivano nei vettori

Tolga Bolukbasi, Kai-Wei Chang, James Zou, Venkatesh Saligrama e Adam Kalai, 21 luglio 2016 (arXiv:1607.06520), mostrano su embedding addestrati su Google News che l'associazione fra receptionist e il femminile sta nello spazio accanto a quella, voluta, fra queen e il femminile. Aylin Caliskan, Joanna J. Bryson e Arvind Narayanan lo misurano con un metodo preso in prestito dalla psicologia, il WEAT, in un lavoro pubblicato su Science nel 2017 (DOI 10.1126/science.aal4230): su GloVe si ritrovano sia associazioni innocue, fiori e insetti, sia pregiudizi di genere e di razza documentati negli esseri umani.

2. L'esempio più citato regge su una riga di codice

«Re meno uomo più donna dà regina» è l'esempio con cui gli embedding si presentano dal 2013. Malvina Nissim, Rik van Noord e Rob van der Goot, in Fair is Better than Sensational: Man is to Doctor as Woman is to Doctor (23 maggio 2019, arXiv:1905.09866, poi in Computational Linguistics), scrivono che «nell'implementazione di default di word2vec, di gensim e nel codice di Bolukbasi e colleghi, i termini in ingresso della domanda di analogia non possono essere restituiti».

Tolto quel vincolo, alla domanda «uomo sta a medico come donna sta a ?» il sistema risponde medico, perché il vettore più vicino al risultato è uno dei tre di partenza. La risposta stereotipata compare solo perché tre parole sono state escluse per costruzione. Lo stesso vale per «regina»: il vincolo che rende bello l'esempio è lo stesso che rende inaffidabili le analogie come diagnosi di pregiudizio, ed è la conclusione del paper.

3. Nessun modello vince su tutto

La conclusione del MTEB, scritta nell'abstract, è che «nessun metodo di text embedding domina su tutti i compiti». Il banco copre 112 lingue e 8 famiglie di compiti, e i punteggi si leggono per lingua e per compito. «Qual è il modello di embedding migliore» è quindi una domanda senza risposta finché non si dice per fare cosa, su quale lingua e su che tipo di testo.

4. Un vettore non si legge

Tremilasettantadue numeri in virgola mobile non dicono niente a chi li guarda. Si possono misurare distanze, si può provare che il sistema recupera i documenti giusti su un insieme di prova, e resta impossibile spiegare a una persona perché due testi sono risultati vicini. Quando una decisione con effetti sulle persone passa da un punteggio di similarità, quel punteggio va accompagnato dai documenti che lo hanno prodotto, che sono l'unica cosa leggibile della catena.

In sintesi

  • I pregiudizi dei testi di addestramento si ritrovano misurabili nei vettori (Bolukbasi 2016, Caliskan 2017).
  • «Re meno uomo più donna dà regina» funziona perché l'implementazione vieta di rispondere con una delle tre parole (Nissim et al., 2019).
  • Su 8 compiti e 112 lingue nessun modello domina, quindi la scelta si fa sul compito (MTEB, 2022).
  • Un vettore da 3.072 numeri non è leggibile: si misura, non si spiega.

06Cosa resta

Dodici anni separano il 53,3% dello skip-gram su 19.544 analogie dai 3.072 numeri di gemini-embedding-2. In mezzo sono cambiati il corpus, la dimensione, l'unità (dalla parola al paragrafo) e il modo di calcolare. L'ipotesi di partenza è rimasta quella di Harris nel 1954: il significato si stima dai contesti, e la stima è una posizione in uno spazio.

Tre cose di questo articolo hanno una data di scadenza corta: le dimensioni e le finestre dei due modelli commerciali, valide al 29 settembre 2026, e la classifica del MTEB, che cambia ogni mese. Tre non ne hanno: il conto della memoria, che dipende solo dall'aritmetica; il fatto che le analogie siano una misura debole del pregiudizio; e che un vettore vada valutato su un insieme di prova del proprio dominio, perché un punteggio medio su 112 lingue non dice come andrà su un archivio di contratti in italiano.

Federico Boggia
L'autore

Federico Boggia

Federico Boggia è docente e formatore, founder di Binatomy. Insegna intelligenza artificiale, programmazione e pensiero computazionale per agenzie, enti e aziende, in aula e online. È laureato in Informatica Umanistica, specializzato in Tecnologie del Linguaggio, e lavora con aziende, enti e agenzie formative: formazione in azienda e progettazione di corsi finanziati. È autore di saggi e articoli su AI, dati ed etica del digitale.

Imparare facendo

Vuoi capire davvero come funzionano questi strumenti?

Tengo corsi di intelligenza artificiale e programmazione per aziende, enti e privati, anche da zero. In aula a Livorno e in Toscana, online in tutta Italia.

Scopri i corsi Prenota coaching 1:1 Iscriviti alla newsletter
Federico BoggiaRispondo io, in giornata

Ciao! Dimmi che ti serve: un corso online, un workshop di AI in aula a Livorno o la formazione per la tua azienda.

Scrivimi su WhatsApp