01Il 7 gennaio 1954, e il conto dell'ALPAC
La prima dimostrazione pubblica di traduzione automatica si tenne il 7 gennaio 1954 nella sede IBM di New York, su un IBM 701. Il sistema veniva dall'Institute of Languages and Linguistics della Georgetown University: l'aveva progettato Leon Dostert con il linguista Paul Garvin, e l'aveva programmato in codice macchina Peter Sheridan di IBM. Il vocabolario era di 250 voci lessicali, le regole erano sei (Hutchins, 2005).
Le frasi tradotte furono, secondo il comunicato IBM e i giornali del giorno dopo, «more than sixty»: quasi tutte di chimica organica. Kachyestvo uglya opryedyelyayetsya kaloryiynostjyu uscì come The quality of coal is determined by calory content. L'operatrice non sapeva il russo, e questo dettaglio finì in prima pagina sul New York Times dell'8 gennaio.
Il comunicato IBM conteneva anche una previsione, che quasi tutte le testate copiarono parola per parola: «five, perhaps three, years hence, interlingual meaning conversion by electronic process in important functional areas of several languages may well be an accomplished fact». Dostert, rispondendo ai giornalisti, aggiunse una stima: 100 regole per governare 20.000 parole in traduzione libera.
Il conto arrivò dodici anni dopo. Nel novembre 1966 l'Automatic Language Processing Advisory Committee, istituito nell'aprile 1964 dal Dipartimento della Difesa, dalla National Science Foundation e dalla CIA e presieduto da John R. Pierce dei Bell Telephone Laboratories, pubblicò Language and Machines: Computers in Translation and Linguistics (National Academy of Sciences, pubblicazione 1416, 124 pagine). Il rapporto vero e proprio sono 34 pagine; le venti appendici, altre 90.
Due frasi dell'ALPAC hanno chiuso i finanziamenti americani alla traduzione automatica per una ventina d'anni. A pagina 16: «There is no emergency in the field of translation». Nel capitolo finale: «we do not have useful machine translation [and] there is no immediate or predictable prospect of useful machine translation». Il rapporto quantificava la spesa federale in «some $20 million» in dieci anni (Hutchins, MT News International 14, giugno 1996).
Quella cifra da venti milioni si cita ancora oggi, e viene dal rapporto stesso. L'appendice 16 la smonta: dentro ci sono 35.033 dollari di convegni, 59.000 per l'ALPAC, 101.250 per ricerca svolta fuori dagli Stati Uniti e 1.362.200 per il gruppo di Zellig Harris alla University of Pennsylvania, che di traduzione automatica non si occupava. Hutchins stima la spesa reale in ricerca americana sulla traduzione automatica fra i 12 e i 13 milioni.
La definizione che condannò il campo
L'ALPAC apre il capitolo sullo stato dell'arte definendo la traduzione automatica come il passaggio «by algorithm from machine-readable source text to useful target text, without recourse to human translation or editing». Con quella definizione i sistemi allora operativi erano fuori per costruzione, perché tutti e due, a Ispra e alla Foreign Technology Division, funzionavano con la revisione umana a valle. Un criterio scelto così decide il risultato prima della misura.
C'è un secondo punto debole nel metodo, e lo segnala Hutchins. L'ALPAC stampò a confronto l'uscita di quattro sistemi generalisti del 1965 e le dodici frasi della dimostrazione del 1954, osservando che le vecchie erano più leggibili. Quelle dodici frasi erano state scelte per un sistema che di parole ne conosceva 250; due dei quattro sistemi del 1965 erano ancora prototipi, e il rapporto non lo scrive.
02Chomsky 1957: la sintassi separata dal senso
Nel 1957 Noam Chomsky pubblica Syntactic Structures da Mouton, all'Aja. L'argomento che ha diviso il campo per quarant'anni sta in poche righe e poggia su due frasi: (1) Colorless green ideas sleep furiously e (2) Furiously sleep ideas green colorless.
It is fair to assume that neither sentence (1) nor (2) (nor indeed any part of these sentences) has ever occurred in an English discourse. Hence, in any statistical model for grammaticalness, these sentences will be ruled out on identical grounds as equally ‘remote’ from English. Yet (1), though nonsensical, is grammatical, while (2) is not.
Noam Chomsky, Syntactic Structures, 1957, citato in Pereira 2000
Il ragionamento è in tre passi: le due frasi non sono mai comparse in inglese; quindi un modello statistico le tratta allo stesso modo; eppure la prima è grammaticale e la seconda no. Su questa pagina si è fondata la separazione fra la linguistica formale nella tradizione di Chomsky e la teoria dell'informazione nella tradizione di Shannon. Sul terzo passo torniamo nella sezione 08, perché la risposta è arrivata nel 2000 e demolisce il secondo.
Dalla stessa stagione viene uno strumento che gli informatici usano ancora: la gerarchia dei linguaggi formali a quattro livelli, regolari, liberi dal contesto, dipendenti dal contesto e ricorsivamente enumerabili. Dice quanta potenza serve a una macchina per riconoscere una certa struttura, ed è il motivo per cui un compilatore si scrive con una grammatica libera dal contesto e non con un'espressione regolare.
I sistemi costruiti scrivendo regole a mano hanno funzionato dentro mondi piccoli. ELIZA, pubblicata da Joseph Weizenbaum su Communications of the ACM 9(1):36-45 nel gennaio 1966, faceva lo psicoterapeuta rigirando all'utente le sue stesse frasi con pochi schemi di riconoscimento. SHRDLU di Terry Winograd, descritto in Cognitive Psychology 3(1):1-191 nel 1972, eseguiva comandi in inglese dentro un mondo di blocchi geometrici. Fuori dal mondo di blocchi le eccezioni diventano più numerose delle regole, e nessuno le scrive tutte.
In sintesi
- 7 gennaio 1954: 250 voci, sei regole, più di sessanta frasi russe su un IBM 701.
- La previsione del comunicato IBM era «cinque, forse tre» anni.
- Novembre 1966: l'ALPAC dichiara che non c'è prospettiva prevedibile di traduzione automatica utile, e i fondi si fermano per vent'anni.
- I venti milioni di dollari citati dall'ALPAC erano probabilmente 12 o 13 spesi davvero in traduzione automatica.
- Chomsky 1957 separa grammaticalità e probabilità con due frasi di cinque parole.
03Dicembre 1988: la frase di Jelinek, e i numeri sotto
La frase che circola è «Every time I fire a linguist, the performance of the speech recognizer goes up». Frederick Jelinek la corresse di persona nella conferenza che tenne a LREC il 28 maggio 2004, riportandone la propria versione e la propria provenienza.
Whenever I fire a linguist our system performance improves.
Frederick Jelinek, LREC 2004, citando il proprio intervento al Workshop on Evaluation of NLP Systems, Wayne PA, dicembre 1988
Nella stessa conferenza Jelinek mise i numeri sotto la battuta, sul compito New Raleigh Language. Con le forme fonetiche scritte dai linguisti e le statistiche del modello acustico fissate dagli esperti, il riconoscitore arrivava al 35% di accuratezza. Con le stesse forme fonetiche e le statistiche stimate dai dati, al 75%.
La terza riga della sua slide è quella che nessuno cita. Sostituendo le forme fonetiche con quelle ortografiche, e continuando a stimare dai dati, l'accuratezza scende al 43%. La conoscenza linguistica valeva 32 punti: serviva a scegliere la forma del modello. I numeri dentro il modello sono un altro mestiere, e quello lo fanno i dati.
Nel giugno 1990 lo stesso gruppo IBM del Thomas J. Watson Research Center di Yorktown Heights pubblica A Statistical Approach to Machine Translation su Computational Linguistics 16(2):79-85, a firma Brown, Cocke, Della Pietra, Della Pietra, Jelinek, Lafferty, Mercer e Roossin (ACL Anthology J90-2002). I dati sono gli Hansard, i verbali bilingui del parlamento canadese: circa 100 milioni di parole inglesi con il francese corrispondente, da cui estraggono circa 3 milioni di coppie di frasi, il 99% delle quali davvero traduzioni l'una dell'altra.
L'esperimento di traduzione vero e proprio è piccolo, e i suoi numeri vanno letti per intero: vocabolario inglese limitato alle 1.000 parole più frequenti, francese alle 1.700, 17 milioni di parametri stimati su 117.000 coppie di frasi, modello bigramma stimato su 570.000 frasi per circa 12 milioni di parole. Su 73 frasi francesi nuove, il 5% esce identico alla traduzione degli Hansard e il 48% viene giudicato dagli autori una traduzione ragionevole.
La matematica completa, i cinque modelli IBM da 1 a 5 con la stima dei parametri, arriva tre anni dopo: Brown, Della Pietra, Della Pietra e Mercer, The Mathematics of Statistical Machine Translation: Parameter Estimation, Computational Linguistics 19(2):263-311, 1993 (ACL Anthology J93-2003). Su quei cinque modelli è passata la traduzione automatica dei vent'anni successivi.
04Le parole diventano vettori: 2003 e 2013
L'ipotesi su cui poggiano i vettori di parole è del 1957, lo stesso anno di Syntactic Structures. John Rupert Firth la riassunse in una riga, in A Synopsis of Linguistic Theory 1930-1955 (Studies in Linguistic Analysis, Philological Society, Oxford).
You shall know a word by the company it keeps.
John Rupert Firth, 1957
Il primo modello neurale del linguaggio che la mette al lavoro porta la firma di Yoshua Bengio, Réjean Ducharme, Pascal Vincent e Christian Jauvin: A Neural Probabilistic Language Model, Journal of Machine Learning Research 3:1137-1155, 2003 (JMLR). Ogni parola diventa un vettore denso, e la rete impara insieme i vettori e la probabilità delle sequenze. Sul corpus Brown, 1.181.041 parole, la perplessità di prova scende del 24% rispetto al miglior n-gramma; sul corpus AP News, dell'8%.
Il costo di quel guadagno sta scritto nel paper: cinque epoche in circa tre settimane su 40 CPU. Il metodo era pubblicato e girava a quella velocità, quindi nessuno ci costruì sopra un prodotto. Nel 2003 mancava il calcolo, e l'idea stava già in una rivista ad accesso libero.
Dieci anni dopo il conto cambia. Tomas Mikolov, Kai Chen, Greg Corrado e Jeffrey Dean depositano Efficient Estimation of Word Representations in Vector Space il 16 gennaio 2013 (arXiv:1301.3781), e nell'abstract c'è la riga che cambia la scala: «less than a day to learn high quality word vectors from a 1.6 billion words data set».
Per misurarsi costruiscono un banco di prova di 8.869 domande semantiche e 10.675 sintattiche. Lo Skip-gram a 300 dimensioni addestrato su 783 milioni di parole risponde bene al 53,3% delle domande; i vettori di Collobert e Weston, 50 dimensioni su 660 milioni di parole, stavano all'11,0%. Da lì l'aritmetica sui significati: sottrarre il vettore di uomo da quello di re e sommare donna porta vicino al vettore di regina.
Un vettore per parola vuol dire un significato per parola. La parola pesca in Word2Vec ha un solo punto nello spazio, a metà fra il frutto e lo sport, e nessuna delle due letture ci sta comoda. I vettori che cambiano con la frase attorno arrivano con ELMo, depositato il 15 febbraio 2018 (arXiv:1802.05365).
05Ricorrenza, memoria, attenzione
Una rete ricorrente legge una parola alla volta e tiene uno stato che fa da memoria. Il suo guasto ha un nome e una data: l'errore che torna indietro nel tempo si dissolve, e Sepp Hochreiter con Jürgen Schmidhuber lo aggirarono con le Long Short-Term Memory, Neural Computation 9(8):1735-1780, 1997. La misura sta nell'abstract: le LSTM imparano a coprire ritardi minimi «in excess of 1000 discrete time steps», con un costo per passo e per peso che resta O(1).
Le due mosse che portano al Transformer sono dell'autunno 2014, a nove giorni di distanza l'una dall'altra.
- 1 settembre 2014. Dzmitry Bahdanau, Kyunghyun Cho e Yoshua Bengio depositano Neural Machine Translation by Jointly Learning to Align and Translate (arXiv:1409.0473). Il vettore di lunghezza fissa in cui l'encoder comprime la frase è «a bottleneck», e il decoder impara a cercarsi da sé i pezzi di frase che gli servono, senza segmentazione dichiarata.
- 10 settembre 2014. Ilya Sutskever, Oriol Vinyals e Quoc V. Le depositano Sequence to Sequence Learning with Neural Networks (arXiv:1409.3215). Sul WMT'14 inglese-francese l'insieme di LSTM arriva a 34,8 BLEU contro i 33,3 del sistema statistico a frasi, e sale a 36,5 riordinando le 1.000 ipotesi di quel sistema.
In quattro anni la traduzione automatica supera i modelli IBM del 1993 usando la loro stessa impostazione probabilistica, con i parametri stimati da una rete al posto che da conteggi di allineamento.
0612 giugno 2017: il Transformer
Attention Is All You Need viene depositato su arXiv il 12 giugno 2017 da Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser e Illia Polosukhin (arXiv:1706.03762). L'architettura si regge «solely on attention mechanisms, dispensing with recurrence and convolutions entirely».
I numeri dichiarati nell'abstract sono due: 28,4 BLEU sul WMT 2014 inglese-tedesco, oltre 2 BLEU sopra i migliori risultati precedenti compresi gli insiemi di modelli, e 41,8 BLEU sull'inglese-francese con un modello solo, dopo 3 giorni e mezzo su otto GPU.
Il guadagno che ha cambiato il campo sta altrove. Una rete ricorrente calcola la posizione n dopo aver calcolato la n-1, e quel vincolo tiene una GPU in attesa di se stessa; la self-attention calcola tutte le posizioni nello stesso passo. Da qui aumentare la scala diventa una questione di budget, e le tappe successive si leggono in miliardi di parametri.
07I grandi modelli linguistici, in cifre
Sulla stessa architettura si sono divise due famiglie, a meno di due anni di distanza.
| BERT | GPT-3 | |
|---|---|---|
| Deposito | 11 ottobre 2018, arXiv:1810.04805 | 28 maggio 2020, arXiv:2005.14165 |
| Componente | Solo l'encoder, bidirezionale | Solo il decoder, autoregressivo |
| Come impara | Maschera alcune parole e le indovina leggendo a destra e a sinistra | Prevede la parola successiva data la sequenza precedente |
| Come si usa | Fine-tuning su ogni compito | Compito descritto nel prompt, «without any gradient updates or fine-tuning» |
| Numeri dichiarati | GLUE 80,5% (+7,7), MultiNLI 86,7% (+4,6), SQuAD 1.1 F1 93,2, SQuAD 2.0 F1 83,1 | 175 miliardi di parametri |
La riga che ha cambiato il mestiere è la quarta. Fino al 2018 usare un modello su un compito nuovo voleva dire riaddestrarlo, quindi serviva un dataset etichettato e una GPU. Con GPT-3 il compito si descrive a parole dentro al testo e i pesi restano fermi. La scrittura dei prompt nasce lì, come effetto collaterale di una riga di abstract.
L'obiettivo di addestramento di un modello generativo resta quello del 1990: assegnare una probabilità alla parola successiva. Le capacità che compaiono oltre una certa scala, dal ragionamento passo passo alla traduzione fra coppie di lingue mai viste insieme, escono da quell'unico obiettivo. È anche il motivo per cui un modello scrive una data inesistente con la stessa scioltezza di una vera: sta scegliendo una continuazione probabile, e in quel punto la continuazione probabile e quella giusta non coincidono.
08Il pendolo, e la risposta a Chomsky del 2000
L'obiezione del 1957 ha ricevuto una risposta precisa, con quarantatré anni di ritardo. Fernando Pereira, Formal grammar and information theory: together again?, Philosophical Transactions of the Royal Society of London A 358(1769):1239-1253, 2000.
Pereira prende un modello aggregato di bigrammi con 16 classi latenti, lo addestra su testo di giornale con l'algoritmo EM e calcola le due probabilità di Chomsky. Il rapporto fra la frase grammaticale e quella sgrammaticata è di circa 2 × 105: duecentomila volte. Un modello semplice distingue le due frasi.
Il difetto dell'argomento del 1957 sta dove nessuno guardava. Da «mai osservate» Chomsky deduceva «probabilità uguali», cosa vera solo per lo stimatore di massima verosimiglianza, che assegna zero a tutto ciò che non ha visto. Lo smoothing che evita quello zero era già pubblicato: il metodo di Good e Turing è del 1953, quattro anni prima di Syntactic Structures.
Il pendolo ha quindi oscillato per quarant'anni attorno a un'obiezione la cui confutazione stava già in biblioteca. Le tappe, messe in fila, si distribuiscono così.
| Data | Che cosa succede | Il numero |
|---|---|---|
| 7 gennaio 1954 | Dimostrazione Georgetown-IBM, regole scritte a mano | 250 voci, 6 regole, oltre 60 frasi |
| 1957 | Chomsky separa grammaticalità e probabilità | 2 frasi di 5 parole |
| novembre 1966 | ALPAC ferma i fondi americani | 34 pagine, 20 appendici |
| dicembre 1988 | Jelinek e la stima dai dati | 35% contro 75% di accuratezza |
| giugno 1990 | Modelli IBM sugli Hansard | 3 milioni di coppie di frasi |
| 2003 | Bengio e il modello neurale del linguaggio | 24% di perplessità in meno su Brown |
| 16 gennaio 2013 | Word2Vec e i vettori a buon mercato | 1,6 miliardi di parole in meno di un giorno |
| 12 giugno 2017 | Transformer, la ricorrenza sparisce | 41,8 BLEU in 3,5 giorni su 8 GPU |
| 28 maggio 2020 | GPT-3, il compito si scrive nel prompt | 175 miliardi di parametri |
09Che cosa misurano davvero i banchi di prova
Il Winograd Schema Challenge nella versione originale ha 273 problemi scritti a mano, pensati per resistere a chi conta le associazioni fra parole. Nel 2019 i modelli neurali ci stavano intorno al 90%, e Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula e Yejin Choi hanno mostrato che una parte di quel punteggio veniva dalle regolarità del dataset.
La prova sta nel banco che costruirono per sostituirlo: WinoGrande, 44.000 problemi ripuliti con l'algoritmo AfLite, depositato il 24 luglio 2019 (arXiv:1907.10641). Lì le persone stanno al 94,0% e i modelli allo stato dell'arte fra il 59,4% e il 79,1%. Un punteggio che sale ammette due letture, il modello ha imparato il compito oppure il banco di prova perde da qualche parte, e distinguerle costa un banco di prova nuovo.
Una fragilità che i punteggi aggregati non mostrano l'ho misurata qui, il 23 settembre 2026, con Bivio, il classificatore che ho scritto e pubblicato con licenza Apache-2.0. Su 22 casi a scelta multipla, ruotando l'ordine delle opzioni senza toccarne il contenuto, Minerva-7B-instruct-v1.0 cambia risposta 19 volte su 22. Qwen3-4B-Instruct-2507, stessa quantizzazione Q4_K_M e stesso prompt, zero volte su 22.
Sullo stesso banco di 31 casi italiani presi da ticket di assistenza, clausole contrattuali e voci di spesa, Qwen3-4B risponde bene a 30 casi su 31 e Minerva-7B a 13, con 188 millisecondi contro 334 a decisione (mediana, quantizzazione Q4_K_M, Apple M5). Sui sei casi in cui la risposta giusta è «non ci sono elementi», Minerva ne prende zero e Qwen cinque.
Il prompt è uno solo ed è stato scritto guardando Qwen. La famiglia Minerva è stata presentata dal gruppo Sapienza NLP il 26 novembre 2024, è addestrata da zero su 2,48 mila miliardi di token e la versione instruct v1.0 non è messa a punto per seguire una scelta multipla su logit. Quel confronto sostiene una cosa sola: per questo mestiere pesa più l'obbedienza al formato dell'istruzione della lingua di addestramento. Il rapporto riga per riga sta in risultati/2026-09-22-m5-qwen3-4b-q4.json del repository, e si rifà con python prove/misura.py.
10L'italiano: da padre Busa alle risorse di oggi
Il trattamento automatico dei testi comincia cinque anni prima della dimostrazione di Georgetown, e comincia con un gesuita italiano. Roberto Busa (Vicenza 1913, Gallarate 2011) nel 1949 va a New York da Thomas J. Watson, fondatore di IBM, e ne ottiene l'appoggio tecnico e scientifico per spogliare a macchina l'opera omnia di Tommaso d'Aquino. Le prove su macchine elettrocontabili a schede perforate sono del 1951. L'Index Thomisticus esce fra il 1974 e il 1980 in 56 volumi di grande formato e copre oltre dieci milioni e mezzo di parole (Treccani).
Antonio Zampolli arriva da lì. Comincia nel 1960 con Busa al Centro per l'Automazione dell'Analisi Linguistica, sta al centro IBM di Pisa come responsabile della linguistica computazionale dal 1967 al 1975, fonda nel 1969 la Divisione Linguistica del CNUCE, che diventa Laboratorio nel 1978 e istituto autonomo nel 1980: l'Istituto di Linguistica Computazionale del CNR, il primo centro italiano dedicato alla disciplina, che dirige fino alla morte il 22 agosto 2003 (CNR-ILC). L'istituto porta oggi il suo nome e sta in via Moruzzi a Pisa.
Il cerchio si chiude a LREC 2004. Nel 2004 l'ELRA assegna il primo Antonio Zampolli Prize, istituito in memoria del proprio presidente fondatore, a Frederick Jelinek, cioè all'uomo della frase sui linguisti licenziati. Per la conferenza di premiazione Jelinek sceglie il titolo Some of my Best Friends are Linguists.
Le risorse italiane di oggi si contano, e la conta è breve.
| Risorsa | Che cos'è | Dimensione | Licenza |
|---|---|---|---|
| UD Italian ISDT | Il treebank di riferimento dell'italiano in Universal Dependencies, curato da Maria Simi a Pisa, nato da MIDT che unisce TUT e ISST-TANL | 14.167 frasi, 278.424 token | CC BY-NC-SA 3.0 |
| UD Latin ITTB | L'Index Thomisticus di Busa annotato sintatticamente, curato da Marco Passarotti e colleghi | 26.977 frasi, 450.480 token | CC BY-NC-SA 3.0 |
| EVALITA | La campagna di valutazione degli strumenti di elaborazione del linguaggio per l'italiano, iniziativa dell'AILC | Dal 2007, nona edizione nel 2026 a Bari | Per campagna |
| Minerva 7B | Modello addestrato da zero anche sull'italiano, gruppo Sapienza NLP | 2,48 mila miliardi di token: 1,14 italiano, 1,14 inglese, 200 miliardi di codice | Apache 2.0 |
Nella tabella c'è una riga da rileggere due volte, e sta nell'ultima colonna. ISDT e ITTB escono con licenza CC BY-NC-SA: il treebank di riferimento dell'italiano e il corpus di Busa si usano per ricerca, e per metterli dentro a un prodotto commerciale bisogna chiedere. Il modello, Minerva, esce Apache 2.0. Chi costruisce in italiano trova il modello aperto e una parte dei dati di valutazione chiusa.
Settant'anni dopo, quello che il 7 gennaio 1954 stava in 250 voci e sei regole si scrive in 2,48 mila miliardi di token. La previsione del comunicato IBM di quel giorno indovinava la direzione e sbagliava i tempi: «cinque, forse tre» anni. La parte italiana della storia, intanto, era già cominciata cinque anni prima, a New York, con un gesuita e una richiesta a Thomas Watson.
In sintesi
- Jelinek nel dicembre 1988 misurò 35% contro 75%: le statistiche dai dati battevano quelle scritte dagli esperti, e le forme fonetiche dei linguisti valevano comunque 32 punti.
- I modelli IBM del 1990 lavoravano su 3 milioni di coppie di frasi e traducevano ragionevolmente 35 frasi su 73.
- Pereira nel 2000 assegna alla frase di Chomsky una probabilità 200.000 volte maggiore di quella sgrammaticata, con un bigramma a 16 classi.
- Su WinoGrande le persone stanno al 94,0% e i modelli fra il 59,4% e il 79,1%: il punteggio alto sul banco vecchio veniva anche dal banco.
- L'Index Thomisticus di padre Busa, cominciato nel 1949 con IBM, è oggi un treebank di Universal Dependencies da 450.480 token.
Federico Boggia