01Che cosa cambia, quando cambia il prompt
Un modello linguistico calcola, una parola alla volta, la continuazione più probabile del testo che ha davanti. Il prompt è quel testo. Cambiandolo si cambia la distribuzione da cui il modello pesca, e di quanto la si cambi è una cosa che qualcuno ha misurato.
La misura più netta è di Melanie Sclar, Yejin Choi, Yulia Tsvetkov e Alane Suhr, pubblicata il 17 ottobre 2023. Tenendo identico il significato della richiesta e cambiando solo la formattazione, cioè i separatori, gli spazi e le maiuscole delle etichette, l'accuratezza di LLaMA‑2‑13B in regime few-shot varia fino a 76 punti percentuali (arXiv:2310.11324). Il prompt dice la stessa cosa, il modello risponde in modo diverso.
Quel numero è la ragione per cui scrivere prompt è un mestiere e non un rito. È anche il rovescio: la stessa sensibilità rende fragile qualunque formula, perché una formulazione che vince su un modello può perdere sul successivo. L'unico modo di saperlo è provarla sullo stesso compito.
Modello linguistico, in due righe
Un large language model assegna una probabilità a ogni parola che potrebbe venire dopo e ne sceglie una fra le più probabili. Non consulta un archivio di fatti: ricostruisce sequenze plausibili. È il motivo per cui può scrivere un nome, una data o una sentenza inesistenti con la stessa scioltezza di quelli veri.
02Cinque tecniche, e quanto vale ciascuna
Le cinque che seguono sono quelle su cui esiste una misura pubblicata. Due valgono meno di quanto promette la pratica corrente, e qui sta scritto quanto.
1. Contesto, formato, destinatario
«Scrivi un testo sul vino» lascia al modello tutto lo spazio delle continuazioni plausibili. «Scrivi un post Instagram di tre frasi per una cantina toscana che presenta un Chianti biologico, tono caldo e diretto, rivolto a chi non è esperto di vino» ne lascia molto meno: ogni vincolo aggiunto taglia via un pezzo di quello spazio. Il meccanismo è questo, e spiega perché le richieste di una riga producono risposte intercambiabili.
2. Il ruolo, che sulla correttezza non incide
Assegnare una persona al modello si insegna dappertutto. Mingqian Zheng, Jiaxin Pei, Lajanugen Logeswaran, Moontae Lee e David Jurgens l'hanno messo alla prova su 162 ruoli, divisi in 6 tipi di relazione e 8 domini di competenza, contro 2.410 domande di fatto e 4 famiglie di modelli. Il risultato: aggiungere il ruolo nel system prompt non migliora l'accuratezza rispetto a non metterlo affatto, e quali ruoli la peggiorino non si prevede in anticipo (arXiv:2311.10054).
Il ruolo resta utile per un'altra cosa: «spiegalo a un artigiano» cambia vocabolario, esempi e livello di dettaglio. Serve a scegliere il registro. Se quello che si cerca è una risposta giusta, il ruolo non la porta.
3. Gli esempi, e di quanto spostano
Mostrare uno o due esempi del risultato voluto è la tecnica che il paper di GPT‑3 chiama few-shot (Tom B. Brown e altri, 28 maggio 2020). Su TriviaQA, GPT‑3 da 175 miliardi di parametri risponde bene nel 64,3% dei casi senza esempi, nel 68,0% con uno e nel 71,2% con una manciata (arXiv:2005.14165). Sono sette punti fra zero esempi e qualche esempio: un guadagno vero, di quelli che si contano.
Gli esempi pesano di più quando conta il formato: email, schede prodotto, risposte alle recensioni, tutto ciò che ha una forma ripetibile. Descrivere uno stile a parole costa più righe che mostrarlo.
4. Una struttura, e poi sempre quella
Separare contesto, istruzione, formato di uscita e vincoli rende la richiesta leggibile a chi la scrive e stabile nel tempo. I 76 punti di Sclar dicono però una cosa in più: non esiste un formato che vinca su tutti i modelli. Quindi conviene fissarne uno, misurarlo sul proprio compito e tenerlo, invece di riscrivere ogni volta da capo e attribuire al caso le differenze.
5. L'iterazione, che è un modo di aggiungere contesto
In una conversazione il giro successivo riceve tutti i messaggi precedenti come parte del prompt. Scrivere «più breve», «togli il terzo punto», «aggiungi un esempio» non è un ripiego: è il modo più economico di aggiungere vincoli, perché il contesto già scritto non si riscrive. La prima risposta è una bozza, e trattarla da prodotto finito butta via il giro che costa meno.
In sintesi
- La sola formattazione sposta l'accuratezza fino a 76 punti: la forma della richiesta è una variabile, non un dettaglio.
- Su 162 ruoli e 2.410 domande, la persona nel system prompt non migliora l'accuratezza. Serve al registro.
- Gli esempi valgono circa 7 punti su TriviaQA fra zero e pochi esempi.
- Un formato fisso e misurato batte un formato nuovo ogni volta.
- Correggere in conversazione aggiunge vincoli senza riscrivere il contesto.
03Chain-of-thought e i due livelli di istruzione
Chain-of-thought: il numero, e la sua data di scadenza
Jason Wei e colleghi, in un lavoro depositato il 28 gennaio 2022, hanno mostrato che chiedere al modello di esporre i passaggi prima della risposta cambia l'esito sui problemi con più passaggi. Su GSM8K, il banco di prova dei problemi di aritmetica scritti a parole, PaLM da 540 miliardi di parametri passa dal 17,9% con prompt standard al 56,9% con otto esempi di ragionamento, superando il 55% del miglior sistema addestrato apposta fino ad allora (arXiv:2201.11903).
Quel guadagno è stato misurato su modelli che non erano stati addestrati a ragionare. Da allora la tecnica è finita dentro ai modelli: quelli con il ragionamento attivo producono da sé una catena di passaggi prima della risposta, e decidono quanto pensarci a seconda della domanda (documentazione Anthropic). Su un modello di questo tipo aggiungere «ragiona un passo alla volta» aggiunge poco. Su un modello piccolo, o su un modello vecchio, i 39 punti di scarto sono ancora lì.
System prompt e user prompt
Chi costruisce un assistente scrive due cose diverse. Il system prompt fissa una volta per tutte ruolo, tono, regole e limiti, e nelle API è un campo separato dai messaggi. Lo user prompt è la singola richiesta. La separazione serve perché le regole stabili restano in cima a ogni chiamata senza essere riscritte, e perché un conto è cambiare la voce di un assistente, un altro è cambiare la domanda di adesso.
| Aspetto | System prompt | User prompt |
|---|---|---|
| Cosa definisce | Ruolo, tono e regole stabili dell'assistente | La singola richiesta del momento |
| Quando si imposta | Una volta, all'avvio dell'applicazione | Ad ogni interazione dell'utente |
| Chi lo scrive | Chi progetta l'assistente | L'utente finale |
| A cosa serve | Coerenza e identità nel tempo | Risolvere il bisogno specifico |
04Quattro errori, e uno con la sentenza
Il 22 giugno 2023 il giudice P. Kevin Castel, del tribunale federale del distretto sud di New York, ha sanzionato con 5.000 dollari gli avvocati Steven A. Schwartz e Peter LoDuca e lo studio Levidow, Levidow & Oberman. Nella causa Mata contro Avianca avevano depositato un atto che citava sei sentenze inesistenti, fra cui Varghese v. China Southern Airlines, generate da ChatGPT; quando la controparte non le trovò, il modello, richiesto, produsse anche gli estratti delle motivazioni. È il caso a cui si torna ogni volta che serve spiegare che cosa vuol dire verificare.
- Richieste di una riga. «Scrivimi un'email» non dice a chi, per dire cosa, con che obiettivo. Ogni vincolo non dichiarato lo sceglie il modello, e lo sceglie sulla media dei testi che ha letto.
- Fermarsi alla prima risposta. Il giro di correzione è quello che costa meno, perché il contesto è già scritto: saltarlo butta via il pezzo più economico del lavoro.
- Non verificare date, nomi, numeri e citazioni. Sono esattamente le quattro cose che un modello ricostruisce come sequenze plausibili. Il caso Mata è nato su una di queste.
- Chiedere ciò che il modello non può sapere. Un documento interno che non è stato passato nel prompt non esiste per il modello, che al suo posto scrive la versione più probabile.
Un modello che inventa non sta funzionando male: sta facendo quello che fa sempre, cioè scegliere la continuazione più probabile, in un punto dove la continuazione probabile non coincide con quella vera. Per questo l'uscita si tratta come una bozza da verificare, e il controllo cresce con la posta in gioco.
05Dove viene usato in Italia, e cosa lo frena
Il dato italiano lo pubblica l'Istat. Nel 2025 il 16,4% delle imprese con almeno dieci addetti usa almeno una tecnologia di intelligenza artificiale, contro l'8,2% del 2024 e il 5,0% del 2023: raddoppia ogni anno. Sotto la media c'è una forbice che conta di più: le grandi imprese stanno al 53,1%, le piccole e medie al 15,7% (Istat, Imprese e ICT 2025).
La riga che riguarda questo articolo è un'altra. Fra le imprese che l'AI l'hanno valutata e poi hanno lasciato perdere, il 58,6% indica come ostacolo le competenze. Seguono la normativa poco chiara (47,3%), la qualità dei dati (45,2%) e, all'ultimo posto, il costo (43%). Il freno dichiarato non è il prezzo dello strumento: è non saperlo usare.
Su questo la scrittura dei prompt è la parte che si impara prima, perché non richiede né infrastruttura né dati puliti. Serve dove il testo esce già strutturato: schede di prodotto, documentazione tecnica, risposte alle recensioni, prima stesura di preventivi, riassunti di verbali. Resta fuori tutto ciò che dipende da dati che l'azienda non ha messo in ordine, che è il secondo e il terzo ostacolo della lista.
06Cosa resta quando cambiano i modelli
Due delle tecniche di questo articolo hanno già perso valore rispetto a quando sono state misurate. Il chain-of-thought è entrato dentro ai modelli di ragionamento, e il ruolo nel system prompt non ha mai spostato l'accuratezza. È l'andamento normale: una tecnica di prompting descrive una mancanza del modello, e quando il modello la copre la tecnica smette di servire.
Regge quello che non dipende dal modello. Dichiarare il destinatario, il formato e i vincoli resta necessario perché sono informazioni che il modello non ha in nessun caso. Verificare date, nomi e citazioni resta necessario finché l'uscita è una sequenza probabile. E tenere un formato fisso e misurato resta l'unico modo di sapere se una modifica ha migliorato qualcosa, dato che 76 punti di scarto possono nascondersi in uno spazio bianco.
In sintesi
- La formattazione da sola vale fino a 76 punti di accuratezza (Sclar et al., 2023).
- Il ruolo nel system prompt non migliora l'accuratezza su 162 ruoli e 2.410 domande (Zheng et al., 2024).
- Il chain-of-thought valeva 39 punti su GSM8K nel 2022, ed è oggi dentro ai modelli di ragionamento.
- Gli esempi valgono circa 7 punti fra zero e pochi esempi su TriviaQA (Brown et al., 2020).
- In Italia il 58,6% di chi rinuncia all'AI indica le competenze come ostacolo, il costo è ultimo al 43% (Istat 2025).
Federico Boggia