A che cosa serve
Ci sono compiti per cui la regola si scrive. Il calcolo dell'IVA è uno: moltiplica per 1,22, e chiunque sappia la regola la applica allo stesso modo. Ci sono compiti per cui la regola nessuno riesce a scriverla, e riassumere una mail è uno di questi: sappiamo riconoscere un buon riassunto quando lo leggiamo, e nessuno ha mai saputo elencare i passi per ottenerlo.
Un LLM (Large Language Model, modello linguistico di grandi dimensioni) serve a quella seconda categoria. Invece di ricevere la regola, la ricava da una quantità enorme di testi scritti da persone. Quello che ne esce è un programma capace di continuare un testo in modo plausibile, e quasi tutto quello che gli chiediamo è una continuazione travestita: una domanda che chiede la sua risposta, una mail che chiede il suo riassunto, un codice che chiede la sua correzione.
Punti chiave
- Un LLM serve dove la regola esiste ma nessuno sa scriverla, e la ricava dai testi invece di riceverla.
- Produce la risposta un pezzo per volta, scegliendo ogni volta la continuazione più probabile.
- Nasce in tre fasi: il pre-addestramento sui testi, la messa a punto sugli esempi, l'allineamento sulle preferenze umane.
- I parametri dicono quanto è grande, la finestra di contesto dice quanto riesce a tenere sott'occhio in una volta.
- L'archivio dei testi originali non ce l'ha: conserva delle regolarità statistiche, e questo spiega sia cosa sa fare sia dove sbaglia.
«Large» si riferisce a due cose insieme: la quantità di testo da cui ha imparato e il numero di valori numerici che ha dentro. Su quei valori, che si chiamano parametri, torniamo più sotto.
Come fa a rispondere, un pezzo per volta
Un LLM non lavora sulle parole intere. Il testo viene prima spezzato in token, che sono pezzi di parola: «intelligenza» può diventare due o tre token, «casa» uno solo. Questo serve al modello per maneggiare anche parole che non ha mai visto, perché i pezzi li ha visti. La faccenda ha una sua voce, Token e Tokenizzazione, ed è il motivo per cui il conto di quanto costa una richiesta si fa in token e non in parole.
Il meccanismo è questo: il modello guarda tutto il testo che ha davanti e calcola, per ogni token possibile della lingua, quanto è probabile che venga dopo. Poi ne sceglie uno, lo aggiunge in fondo, e ricomincia da capo con il testo allungato di un pezzo. Una risposta di trecento parole è questo giro ripetuto quattrocento volte.
Conviene vederlo su una frase vera. Queste sono le continuazioni che un modello dà a «Il gatto mangia sul», con la probabilità che assegna a ognuna:
| Continuazione | Probabilità |
|---|---|
| tav (tavolo) | 77,66% |
| div (divano) | 7,01% |
| letto | 1,43% |
| pav (pavimento) | 0,95% |
| balcon (balcone) | 0,93% |
| tet (tetto) | 0,35% |
Quasi nessuna di quelle continuazioni è una parola. Il modello sceglie «tav», e solo al passo dopo aggiunge «olo», con una probabilità del 99,96%. La parola «tavolo» viene fuori da due passaggi, di cui uno solo era davvero una scelta. Lavorare a token vuol dire questo, e spiega perché a volte un modello comincia una parola e la finisce in un modo che non ti aspettavi.
La seconda cosa si vede cambiando frase, e prendo «Il contratto deve essere firmato dal»:
| Continuazione | Probabilità |
|---|---|
| cliente | 21,84% |
| rapp (rappresentante) | 18,51% |
| sog (soggetto) | 6,62% |
| dat (datore) | 4,62% |
| leg (legale) | 2,26% |
Le due frasi sono lunghe uguale e hanno un destino diverso. Sul gatto una continuazione si prende il 77%: la frase è quasi decisa e il modello ha poco spazio per sbagliare. Sul contratto la prima arriva al 21,84% e dietro ne stanno dieci che si somigliano, quindi il modello sta scegliendo quasi a caso fra opzioni tutte plausibili. La risposta esce con lo stesso tono sicuro nei due casi, e questa è l'origine di quasi tutti i guai.
La forma della distribuzione dipende da quanto il contesto stringe il campo. Qui sta il motivo per cui dare contesto funziona: ogni informazione in più toglie opzioni, e un modello con poche opzioni davanti sbaglia meno. Un contratto di cui hai allegato il testo sposta quella tabella molto più di qualunque istruzione su come rispondere.
Da dove vengono questi numeri
Misurati il 7 ottobre 2026 su Qwen3-4B-Instruct (quantizzato Q4_K_M) che gira in locale con llama.cpp, leggendo la distribuzione del token successivo. Un modello più grande dà numeri diversi e la forma resta quella. Si rifà così:
llama-server -m Qwen3-4B-Instruct-2507-Q4_K_M.gguf --port 8913
curl -s localhost:8913/completion -d '{"prompt":"Il gatto mangia sul","n_predict":1,"n_probs":12,"top_k":0,"top_p":1.0}'
Perché la stessa domanda dà risposte diverse
La scelta del token successivo contiene un pizzico di casualità, regolata da un valore che si chiama temperatura. Con temperatura bassa il modello prende quasi sempre il token più probabile e le risposte si somigliano; alzandola prende più spesso il secondo o il terzo, e le risposte si differenziano. È una manopola, e nelle app è impostata da chi le ha fatte.
Da qui discende una cosa che conviene tenere a mente: il testo viene composto mentre lo leggi, e il modello non può tornare indietro su quello che ha già scritto. Quando una frase prende una direzione sbagliata, quello che segue cerca di raddrizzarla andando avanti. Le autocorrezioni che compaiono nei testi lunghi generati, del tipo «più che un problema, un'occasione», nascono lì.
Come se ne costruisce uno: tre fasi
Le tre fasi hanno costi e durate molto diverse, e confonderle porta a credere che il modello impari dalle conversazioni, cosa che nella fase in cui lo usi non succede.
- Pre-addestramento. Il modello legge una quantità enorme di testo e si allena a indovinare il pezzo successivo. Qui si formano la grammatica, la sintassi e le regolarità del mondo che stanno nei testi. È la fase lunga e costosa, si fa una volta per versione, e dura settimane o mesi su migliaia di schede grafiche.
- Messa a punto sulle istruzioni (fine-tuning). Al modello grezzo si mostrano esempi di richiesta e risposta ben fatta, perché dopo il pre-addestramento sa continuare un testo e non ancora obbedire a un ordine. Dura molto meno. Questa fase si può rifare anche su dati propri: ha la sua voce, Fine-Tuning dei Modelli AI.
- Allineamento sulle preferenze (RLHF, Reinforcement Learning from Human Feedback). Delle persone confrontano coppie di risposte e dicono quale è migliore; da quei giudizi si ricava un segnale che sposta il comportamento del modello. Qui si decidono il tono, la disponibilità a rifiutare una richiesta e quella tendenza a dare ragione all'utente che in alcuni modelli si nota subito.
Finito questo giro, i valori interni restano fermi. Il modello che risponde oggi è identico a quello di ieri, e le tue conversazioni non lo modificano. Possono finire nei dati di un addestramento futuro, che è un'altra faccenda e dipende dal piano che hai: le condizioni cambiano fra account personali e aziendali, ed è scritto nelle informative di ogni fornitore.
I parametri: quanto è grande
I parametri sono i numeri che il modello ha imparato durante il pre-addestramento, e sono quello che resta dei testi letti. Un modello «da 7 miliardi di parametri» ha sette miliardi di questi valori. Nelle reti neurali si chiamano pesi e bias: un LLM è una rete neurale molto grande, con l'architettura Transformer.
Il numero di parametri dice tre cose pratiche:
| Più parametri vuol dire | In pratica |
|---|---|
| Più capacità | Regge compiti più complicati e sfumature più fini |
| Più memoria occupata | Un modello piccolo gira su un portatile, uno grande vuole un centro dati |
| Più costo per risposta | Ogni token generato richiede di attraversare tutti i parametri |
Il numero da solo dice poco: un modello piccolo e addestrato bene batte un modello grande e addestrato male, e per molti compiti di ufficio un modello piccolo basta e avanza. Chi deve scegliere guarda i risultati sul proprio lavoro, non la dimensione.
I parametri contengono regolarità, non i testi. Il modello non ha in pancia una copia dei documenti su cui si è addestrato, e per questo quando gli chiedi una cosa precisa che ha visto una volta sola, come un articolo di legge o il numero di una fattura, la ricostruisce sbagliata con la stessa sicurezza con cui ne azzecca altre.
La finestra di contesto: quello che ha sott'occhio
La finestra di contesto è la quantità di token che il modello riesce a tenere davanti mentre risponde. Dentro ci sta tutto: le istruzioni iniziali messe da chi ha fatto l'applicazione, i documenti che hai allegato, lo scambio di messaggi fino a quel punto e la tua ultima domanda.
Due conseguenze che si incontrano tutti i giorni:
- La memoria finisce. In una chat lunga i messaggi più vecchi escono dalla finestra, e da quel momento il modello si comporta come se non fossero mai stati scritti. Le app lo mascherano riassumendo quello che esce, quindi il salto si nota poco e il dettaglio si perde lo stesso.
- Riempirla tutta peggiora le risposte. Con un contesto molto lungo l'informazione che sta in mezzo viene usata peggio di quella all'inizio e alla fine: è un effetto misurato, e il lavoro che lo ha reso noto è Lost in the Middle (Liu et al., 2024). Tradotto in pratica: incollare un bando di sessanta pagine e chiedere il progetto intero dà un risultato peggiore che lavorare per blocchi.
Le finestre dichiarate dai fornitori crescono di versione in versione e si leggono sulla loro documentazione; il confronto fra gli LLM le tiene aggiornate. Il conto esatto dei token di un testo lo dà il fornitore stesso, perché ogni famiglia di modelli spezza le parole a modo suo: contare i token di un modello con lo strumento di un altro dà un numero sbagliato.
Quattro cose che un LLM non fa
Quasi tutti i guai in azienda nascono da una di queste quattro, e tutte e quattro discendono dal meccanismo descritto sopra.
- Cercare in un archivio. La risposta viene composta sul momento. Quando serve che risponda su documenti tuoi, quei documenti glieli devi mettere nel contesto, ed è il mestiere del RAG.
- Fare i conti. Calcola probabilità sulle parole, quindi sui numeri va a somiglianza. Sulle cifre, sulle date e sui riferimenti di legge è dove sbaglia di più, e il risultato va ricontrollato sempre. Le app recenti aggirano la cosa facendogli scrivere ed eseguire del codice: quando lo fa, il conto è giusto perché lo ha fatto un calcolatore.
- Sapere com'è andata a finire. Il pre-addestramento si ferma a una certa data, e di quello che è successo dopo il modello sa quello che gli metti nel contesto o quello che trova se l'applicazione lo lascia cercare sul web.
- Imparare da te. Durante l'uso i parametri restano fermi. Quando un assistente sembra ricordarsi di te, l'applicazione gli sta rimettendo davanti qualcosa che aveva salvato, e il ricordo sta lì e non nel modello.
Quando la risposta inventata è dettagliata e sicura di sé si parla di allucinazione. Il nome fa pensare a un guasto occasionale; il comportamento è quello normale del meccanismo, che produce sempre la continuazione più probabile anche quando di informazione non ne ha. Gli errori comuni nell'AI partono quasi tutti da qui.
Modello, assistente, applicazione
Nel parlato quotidiano le tre cose si chiamano tutte «ChatGPT», e tenerle separate serve ogni volta che qualcosa va storto, perché dice a quale dei tre livelli guardare.
| Livello | Che cos'è | Esempio di problema |
|---|---|---|
| Modello | Il motore di calcolo: riceve token e restituisce token | Sbaglia un ragionamento, inventa una fonte |
| Assistente | La chat: tiene la cronologia, aggiunge le istruzioni iniziali, imposta il tono | Perde il filo in una conversazione lunga |
| Applicazione | Il contenitore: ricerca sul web, lettura dei file, accesso ai tuoi documenti, gli strumenti | Non vede l'allegato, usa l'account sbagliato |
Lo stesso modello dentro applicazioni diverse si comporta in modo diverso, e il merito o la colpa sono quasi sempre del contesto che l'applicazione gli passa. È il motivo per cui un assistente integrato negli strumenti di lavoro risponde meglio sulle cose dell'azienda rispetto alla stessa chat aperta su una pagina vuota: sta leggendo documenti che l'altra non vede.
Il salto successivo si chiama agente: un'applicazione che, oltre a generare testo, può compiere azioni e guardare il risultato prima di decidere la mossa dopo. Quello che resta vero è il meccanismo di fondo, cioè che a ogni passo sta scegliendo la continuazione più probabile.
Glossario
| Termine | Significato |
|---|---|
| Token | Il pezzo di testo su cui il modello lavora, di solito una parte di parola |
| Parametri | I numeri imparati durante l'addestramento: dicono quanto il modello è grande |
| Finestra di contesto | Quanti token riesce a tenere davanti mentre risponde |
| Prompt | Il testo che gli dai in ingresso, istruzioni e materiale compresi |
| Temperatura | Quanta casualità mettere nella scelta del token successivo |
| Transformer | L'architettura di rete neurale su cui sono costruiti gli LLM, dal 2017 |
| Allucinazione | Una risposta inventata e detta con sicurezza |
| RLHF | L'allineamento del comportamento a partire da giudizi di persone |
L'architettura Transformer è stata presentata in Attention Is All You Need (Vaswani et al., 2017), ed è il lavoro da cui discendono tutti i modelli linguistici di oggi. Come è fatta dentro sta nella voce sulle reti neurali artificiali.