Nel 2025 il 16,4% delle imprese italiane con almeno dieci addetti usa almeno una tecnologia di intelligenza artificiale, contro l'8,2% del 2024 e il 5,0% del 2023. Fra le imprese che l'hanno valutata e si sono fermate, il 45,2% indica come ostacolo l'indisponibilità o la scarsa qualità dei dati necessari (Istat, Imprese e ICT 2025, pubblicato il 15 dicembre 2025). Quel 45,2% è la riga che riguarda la Retrieval-Augmented Generation, perché la RAG non porta dati nuovi: mette in fila quelli che l'azienda ha già.
01Cosa frena l'AI nelle imprese italiane
La graduatoria degli ostacoli dichiarati all'Istat mette il prezzo degli strumenti all'ultimo posto.
| Ostacolo dichiarato | Quota delle imprese | Riguarda un progetto RAG? |
|---|---|---|
| Mancanza di competenze adeguate | 58,6% | Sì, e serve prima di scegliere gli strumenti |
| Normativa poco chiara | 47,3% | Sui dati personali dentro ai documenti |
| Indisponibilità o scarsa qualità dei dati | 45,2% | È il collo di bottiglia della fase di ingestione |
| Privacy e protezione dei dati | 43,2% | Decide se il modello di embedding gira in casa |
| Costo troppo elevato | 43,0% | Poco: l'indicizzazione costa meno di un pranzo |
| Considerazioni etiche | 25,7% | Sulle decisioni prese a valle della risposta |
La forbice dentro al 16,4% dice il resto: le grandi imprese stanno al 53,1%, le piccole e medie al 15,7%. Un progetto RAG in una piccola impresa parte quindi da un archivio che nessuno ha mai riordinato, e quel riordino è il lavoro che la tecnologia non fa al posto di nessuno.
Quello che la RAG mette a disposizione è un archivio interrogabile a voce, con la fonte accanto alla risposta: quale manuale, quale sezione, quale revisione. Il meccanismo con cui ci riesce, componente per componente e con le misure pubblicate, sta in RAG: quanto vale ogni pezzo dell'architettura. Questa pagina guarda l'altra metà: cosa succede quando i documenti sono quelli veri di un'azienda.
02Le tre fasi, e la quarta che decide
Le tre lettere della sigla descrivono quello che succede quando qualcuno fa una domanda.
R come Retrieve
La domanda diventa un vettore numerico con lo stesso modello di embedding usato per indicizzare, e il database vettoriale restituisce i frammenti più vicini. Se il modello non è lo stesso, i due vettori vengono da due mappe diverse e il risultato è casuale senza che niente segnali l'errore.
A come Augment
I frammenti recuperati entrano nel prompt insieme alla domanda. Da tre a cinque frammenti, e non venti: con il frammento giusto in decima posizione fra venti, GPT‑3.5‑Turbo scende al 53,8% contro il 75,8% che ottiene con lo stesso frammento in testa (Liu et al., 6 luglio 2023, arXiv:2307.03172).
G come Generate
Il modello scrive la risposta su quel materiale e, se le istruzioni di sistema lo impongono, indica da quale frammento arriva ciascuna affermazione.
La quarta fase non sta nella sigla e decide il progetto: l'ingestione. I documenti vengono estratti dai PDF, dai Word e dalle pagine intranet, ripuliti, spezzati, arricchiti di metadati e trasformati in vettori. Avviene una volta sola, prima che qualcuno faccia la prima domanda, e il 45,2% dell'Istat si scarica tutto qui.
I sei pezzi, e chi li mantiene
Document loader: estrae il testo da PDF, DOCX, HTML e Markdown, ed è dove muoiono le scansioni. Chunker: divide il testo in frammenti. Modello di embedding: trasforma ogni frammento in un vettore. Database vettoriale: archivia e indicizza. Retriever: cerca e riordina. Modello generativo: scrive. I primi due sono i più noiosi e sono quelli che decidono la qualità finale.
03L'embedding, e quanto costa indicizzare un archivio
Il costo di indicizzazione si calcola, e il conto smentisce il 43,0% dell'Istat che indica il prezzo fra gli ostacoli. Un archivio tecnico di tremila documenti da otto pagine l'uno, con cinquecento parole a pagina, sta intorno ai venti milioni di token. Il listino di Voyage AI, letto il 29 settembre 2026, mette voyage-4 a 0,06 dollari per milione di token: quell'archivio si indicizza per 1,20 dollari, e i primi 200 milioni di token sono gratuiti (docs.voyageai.com/docs/pricing).
La cifra vale per una passata sola. Si moltiplica per ogni volta che si cambia strategia di chunking o modello di embedding, perché l'indice va rifatto da capo. Anche a dieci passate, il conto sta sotto ai tredici dollari. Il costo del progetto sta altrove: nelle settimane di pulizia documentale, e in chi le fa.
Italiano, e dati che restano dentro
Due vincoli restringono la scelta prima delle prestazioni. Il primo è la lingua: la documentazione Cohere, alla stessa data, dichiara embed-multilingual-v3.0 su oltre cento lingue con 1024 dimensioni, mentre embed-english-v3.0 è solo inglese (docs.cohere.com). Un modello addestrato quasi solo su testo inglese, messo su manualistica tecnica italiana, perde sulle sigle di reparto e sui termini di mestiere.
Il secondo vincolo è il 43,2% che all'Istat dichiara la privacy come ostacolo. Ogni frammento mandato a un servizio di embedding esce dall'azienda. Un modello a pesi aperti eseguito su una macchina interna tiene i documenti dentro, e costa una GPU invece di una fattura mensile. La scelta si fa prima dell'architettura, perché cambiarla dopo vuol dire rifare l'indice.
Prima di scegliere servono da 50 a 100 domande vere, raccolte da chi in azienda quelle domande le fa, con accanto il documento che contiene la risposta. Poi si indicizza lo stesso corpus con tre modelli diversi e si conta quante volte il documento giusto compare fra i primi dieci risultati. Una classifica pubblica misura corpora che non sono quelli dell'azienda; questo conto misura i suoi.
04Chunking e metadati: cosa serve per filtrare
La dimensione del frammento decide cosa il retrieval riuscirà a trovare. Per la documentazione aziendale le dimensioni che si confrontano stanno fra 512 e 1.024 token, con una sovrapposizione fra il 10% e il 15% fra frammenti consecutivi, e la scelta si fa sul corpus reale con il conto della sezione precedente.
La strategia cambia con il documento. Un manuale con titoli e sottotitoli si spezza per struttura, scendendo ai separatori più piccoli solo dove il blocco sfora. Un verbale scritto di seguito si spezza a dimensione fissa. Una tabella di parametri macchina non si spezza affatto: tagliata a metà, la colonna dei valori resta senza le intestazioni e il frammento diventa illeggibile anche per una persona.
I metadati, e perché vanno decisi prima
Ogni frammento si porta dietro nome del documento, sezione, pagina, data di revisione, codice macchina e reparto. Servono a due cose che in azienda contano più della qualità della prosa: filtrare, cioè escludere una procedura ritirata o mostrare solo i documenti del reparto di chi chiede, e citare, cioè dire alla fine della risposta quale pagina di quale revisione.
Sul filtro c'è un dettaglio operativo che costa una reindicizzazione a chi lo scopre dopo. La documentazione di Qdrant, letta il 29 settembre 2026, scrive che gli indici sul payload non nascono da soli: «Qdrant does not make this choice but grants it to the user», e raccomanda di crearli prima di caricare i dati, perché l'indice HNSW viene costruito tenendo conto dei filtri (qdrant.tech).
PDF scansionati con un OCR che confonde 0 e O nei codici prodotto, tre versioni della stessa procedura senza una data che le ordini, allegati duplicati in quattro cartelle. Indicizzati così, quei documenti producono frammenti che il retrieval restituisce con la stessa convinzione degli altri. La pulizia documentale si fa prima, e la fa qualcuno che conosce i documenti e decide quale versione vale.
05Il database: quanta RAM chiede un archivio
Il dimensionamento di un database vettoriale si calcola con una moltiplicazione, e la documentazione di Qdrant la scrive per esteso. Si parte dal numero di frammenti moltiplicato per il fattore di replica; da lì, lo spazio dei vettori è base × dimensioni × byte per dimensione, con 4 byte per dimensione in virgola mobile a 32 bit, che è il tipo predefinito.
| Struttura | Formula documentata | Un milione di frammenti, 768 dimensioni, replica 2 |
|---|---|---|
| Vettori densi | base × dimensioni × 4 byte | circa 5,72 GB |
| Indice HNSW | base × m × 2 × 4 byte × 1,2, con m = 16 | circa 0,29 GB |
| Vettori quantizzati a 4 bit | base × dimensioni × 0,5 byte | circa 0,72 GB |
Le formule e i tre esempi vengono dalla pagina di capacity planning di Qdrant letta il 29 settembre 2026 (qdrant.tech/documentation/capacity-planning). Un archivio da un milione di frammenti, che per documenti tecnici vuol dire qualche centinaio di migliaia di pagine, sta in sei gigabyte di memoria su una macchina sola. La stessa pagina avverte che la quantizzazione va verificata contro i risultati non quantizzati prima di tenerla, perché alcuni modelli di embedding perdono accuratezza quando i vettori vengono compressi.
Il conto serve a chiudere una discussione che in azienda si apre sempre. Un progetto RAG su documentazione interna non ha bisogno di un'infrastruttura: ha bisogno di una macchina con sedici gigabyte e di qualcuno che tenga in ordine i documenti.
06Cinque errori, e il 45,2% che ne spiega uno
Errore 1: documenti sporchi indicizzati lo stesso
È l'ostacolo che il 45,2% delle imprese italiane dichiara all'Istat, e in un progetto RAG si presenta come risposte esatte prese dalla revisione sbagliata. Validare l'OCR, normalizzare i formati, cancellare le versioni superate e deduplicare viene prima di ogni scelta tecnica, perché nessun componente a valle distingue un documento ritirato da uno in vigore.
Errore 2: chunk dimensionati a intuito
Frammenti da 200 token reggono su una raccolta di FAQ e falliscono su un testo normativo, dove una condizione si sviluppa su tre paragrafi. Frammenti da 2.000 token portano nel prompt quattro argomenti per volta. La dimensione si sceglie confrontando il recall@10 su un insieme di domande annotate, a 256, 512 e 1.024 token.
Errore 3: niente re-ranking
La ricerca per similarità è veloce e approssimata, e i primi venti risultati mescolano frammenti pertinenti e frammenti vicini per caso. Un re-ranker legge domanda e frammento insieme e riordina. Conta più di quanto sembri: con 22 punti di scarto fra la prima e la decima posizione nel contesto, decidere chi sta in testa vale quanto decidere chi entra.
Errore 4: risposte che nessuno verifica
Un modello può ignorare i frammenti e rispondere a memoria, cucire insieme due frammenti incompatibili o riempire un buco. Senza un controllo automatico, queste risposte arrivano all'utente con la stessa forma di quelle giuste. Quanto sia frequente anche in prodotti costruiti bene sta nella sezione seguente.
Errore 5: metadati rimandati
Un frammento archiviato come puro testo non si filtra per reparto, non si esclude per data e non si cita. Rimediare vuol dire reindicizzare l'archivio, e su Qdrant vuol dire anche ricostruire l'indice, che i filtri li tiene in conto quando lo si crea.
I quattro punti che decidono la qualità finale stanno tutti prima del modello generativo: quali documenti entrano, come sono tagliati, quali metadati portano, come vengono cercati. Cambiare il modello che scrive la risposta è la leva più visibile e quella che sposta meno: un modello migliore scrive meglio lo stesso frammento sbagliato.
07Validare: due prodotti misurati, e quanto sbagliano
Varun Magesh, Faiz Surani, Matthew Dahl, Mirac Suzgun, Christopher D. Manning e Daniel E. Ho, di Stanford, hanno depositato Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools il 30 maggio 2024 (arXiv:2405.20362). Hanno provato con 202 domande preregistrate tre prodotti commerciali costruiti sulla RAG e venduti a studi legali: Lexis+ AI di LexisNexis, Westlaw AI-Assisted Research e Ask Practical Law AI di Thomson Reuters.
Il risultato, con le parole degli autori: «we find that the AI research tools made by LexisNexis (Lexis+ AI) and Thomson Reuters (Westlaw AI-Assisted Research and Ask Practical Law AI) each hallucinate between 17% and 33% of the time». Lexis+ AI risponde correttamente nel 65% dei casi, Westlaw AI-Assisted Research nel 42%. I fornitori dichiaravano il problema risolto proprio grazie alla RAG.
Sono sistemi costruiti su un corpus curato da redazioni giuridiche, con budget di sviluppo che nessuna media impresa ha. Un assistente interno costruito in tre mesi su un archivio non ripulito sta sotto quei numeri, e la conseguenza progettuale è che la verifica non si rimanda alla fase due.
- Controllo di ancoraggio. Una seconda passata che spezza la risposta in affermazioni e verifica ciascuna contro i frammenti recuperati. È la stessa operazione che RAGAS chiama faithfulness, descritta con la sua formula in RAG: quanto vale ogni pezzo.
- Citazione obbligatoria. Documento, sezione e revisione accanto a ogni affermazione. Senza metadati sul frammento questa riga non si può scrivere.
- Soglia di rinuncia. Se nessun frammento supera una similarità minima, il sistema dichiara di non avere l'informazione. Il generatore, senza soglia, riceve comunque un contesto fuori tema e scrive.
- Guardrail. Un secondo modello, più piccolo, legge la risposta prima che esca e controlla che ogni affermazione stia nei frammenti. Costa una chiamata in più per risposta.
- Segnalazioni dagli utenti. Un pulsante per marcare una risposta sbagliata, e qualcuno che legge le segnalazioni. È l'unico canale che vede gli errori che le metriche automatiche non vedono.
In sintesi
- Su 202 domande, tre prodotti RAG commerciali allucinano fra il 17% e il 33% delle volte (Magesh et al., 30 maggio 2024).
- Lexis+ AI risponde correttamente nel 65% dei casi, Westlaw AI-Assisted Research nel 42%.
- Citazione e soglia di rinuncia dipendono da scelte prese nella fase di ingestione, non alla fine.
08Un caso misurato, in produzione da sei mesi
Zhentao Xu, Mark Jerome Cruz, Matthew Guevara, Tie Wang, Manasi Deshpande, Xiaofeng Wang e Zheng Li, dell'assistenza tecnica di LinkedIn, hanno pubblicato il 26 aprile 2024 la descrizione di un sistema in esercizio (arXiv:2404.17723). Il problema di partenza è quello di qualunque archivio aziendale: i ticket di assistenza passati, trattati come testo piatto, perdono la struttura interna di ogni ticket e i legami fra ticket diversi.
La correzione non tocca il modello generativo. I ticket vengono trasformati in un grafo che conserva i campi di ciascuno e i collegamenti fra problemi simili, e il retrieval cerca lì dentro. Le misure dichiarate: +77,6% di MRR sul recupero del ticket pertinente e +0,32 di BLEU sulla risposta generata.
Il numero per chi paga il progetto è l'ultimo. Dopo circa sei mesi dentro al servizio clienti di LinkedIn, il tempo mediano di risoluzione per ticket è sceso del 28,6%. È una mediana misurata su un semestre di lavoro vero, non una stima messa in una proposta commerciale.
La lezione trasferibile a un archivio italiano di manuali e procedure sta nella direzione dell'intervento. Il guadagno è venuto dall'aver conservato la struttura dei documenti invece di appiattirla in testo. È la stessa cosa che, alla scala di una media impresa, si chiama tenere i metadati e spezzare i documenti rispettando le sezioni.
Cosa portare a casa
- Indicizzare venti milioni di token costa 1,20 dollari; la pulizia dei documenti costa settimane, ed è il 45,2% dichiarato all'Istat.
- Un milione di frammenti da 768 dimensioni con replica 2 sta in circa 6 GB di RAM, indice compreso.
- Tre prodotti RAG commerciali misurati da Stanford allucinano fra il 17% e il 33%: la verifica automatica va progettata dal primo giorno.
- A LinkedIn il tempo mediano di risoluzione è sceso del 28,6% conservando la struttura del corpus, non cambiando modello.
09Glossario
RAG, ingestione, chunking
RAG: si recuperano i frammenti pertinenti da una base documentale e si mettono nel prompt, senza riaddestrare il modello. Ingestione: la fase che porta i documenti dentro all'indice, dall'estrazione del testo all'archiviazione dei vettori; avviene una volta e si rifĂ a ogni cambio di strategia. Chunking: la suddivisione in frammenti, di solito fra 512 e 1.024 token per la documentazione tecnica, con sovrapposizione dal 10% al 15%.
Embedding, metadati, database vettoriale
Embedding: il vettore che colloca un frammento in uno spazio a molte dimensioni; le serie attuali offrono da 256 a 2048 dimensioni a scelta. Metadati: i campi attaccati a ogni frammento, cioè documento, sezione, pagina, revisione e reparto; servono a filtrare e a citare. Database vettoriale: l'archivio che cerca per vicinanza; un milione di frammenti da 768 dimensioni con replica 2 occupa circa 5,72 GB di vettori più 0,29 GB di indice HNSW.
Re-ranking, ancoraggio, soglia di rinuncia
Re-ranking: il secondo stadio che legge domanda e frammento insieme e riordina i primi 20 o 50 candidati. Ancoraggio: il legame fra ogni affermazione della risposta e il frammento che la sostiene; RAGAS lo conta come rapporto fra affermazioni sostenute e affermazioni totali. Soglia di rinuncia: la similarità minima sotto la quale il sistema dichiara di non avere l'informazione invece di generare.
Federico Boggia