I modelli in campo
I Large Language Model (LLM) sono modelli addestrati su enormi quantità di testo per capire e produrre linguaggio. Le famiglie che contano oggi sono tre chiuse, ChatGPT, Claude e Gemini, più il gruppo dei modelli a pesi aperti, che nel 2026 ha cambiato faccia: Meta ha messo Llama in secondo piano, e i modelli aperti più forti li fanno DeepSeek, Alibaba con Qwen e, in Europa, Mistral. La differenza fra le famiglie è più piccola della differenza fra usarle bene e usarle male: detto questo, su alcuni compiti la scelta si sente, ed è di quelli che vale la pena parlare.
Punti chiave
- Ogni modello eccelle in ambiti diversi, e chi ci lavora sul serio ne usa più di uno.
- ChatGPT punta su ecosistema, agenti e immagini; Claude su scrittura, analisi di testi lunghi e lavoro dentro al computer (Claude Code, connettori); Gemini sull'integrazione con Google e sul prezzo; i modelli aperti su controllo, privacy e costo.
- Nel 2026 tutti e tre i modelli chiusi arrivano a un milione di token di contesto: la finestra ha smesso di essere il criterio che li separa. Contano la multimodalità, il prezzo API e gli strumenti attorno.
- La qualità del prompt conta più della scelta del modello: investire nel prompt engineering produce un ritorno superiore al semplice cambio di LLM.
- Verificare sempre fatti e citazioni: nessun modello è infallibile e il controllo finale resta responsabilità di chi lo usa.
La scelta del modello giusto dipende dal caso d'uso, dal budget e dalle esigenze specifiche. Ogni LLM eccelle in ambiti diversi, e molti professionisti utilizzano più modelli in modo complementare.
Tabella comparativa
| Caratteristica | ChatGPT (GPT-6 Astra) | Claude (Opus 5, Fable 5.1) | Gemini (3.1 Pro) | Modelli aperti (DeepSeek, Qwen, Llama, Mistral) |
|---|---|---|---|---|
| Azienda | OpenAI | Anthropic | DeepSeek, Alibaba, Meta, Mistral e altri | |
| Modello di punta (settembre 2026) | GPT-6 Astra, dal 3 settembre 2026; sotto GPT-6 Sol e Luna, dal 22 settembre, poi la serie GPT-5.6 e GPT-5.5 | Opus 5 per la maggior parte del lavoro, Fable 5.1 sopra, Sonnet 5 per la velocità | Gemini 3.1 Pro, con Deep Think; i Flash fino alla 3.8 | DeepSeek V4 Pro, Qwen 3.8, Mistral Large 3, Llama 4 |
| Prezzo consumer | Gratis / Plus 20 $ al mese / Pro fino a 200 $ | Gratis / Pro 20 $ al mese / Max da 100 $ | Gratis / AI Plus / AI Pro 19,99 $ al mese / AI Ultra da 100 $ | Gratis nelle app dei produttori (DeepSeek, Qwen, Le Chat), oppure si ospitano da soli |
| Finestra di contesto | Circa 1M token | 1M token | 1M token | 1M token (DeepSeek V4, Qwen 3.8), fino a 10M (Llama 4 Scout) |
| Multimodale | Testo, immagini, audio, video | Testo, immagini, PDF e file | Testo, immagini, audio, video | Dipende dal modello: testo e immagini nei principali |
| Navigazione web | Sì | Sì | Sì (Google Search) | Dipende dall'interfaccia che li ospita |
| Generazione immagini | Sì (GPT Image), e video con Sora | No | Sì (Gemini Image, Imagen), e video con Veo | Con modelli a parte |
| API | Sì: Astra 10 $ / 50 $, Sol 2 $ / 10 $, Luna 0,10 $ / 0,50 $ per milione di token (input / output) | Sì: Opus 5 5 $ / 25 $, Sonnet 5 2 $ / 10 $, Fable 5.1 10 $ / 50 $ | Sì: 3.1 Pro 2 $ / 12 $, 3.8 Flash 0,75 $ / 3,75 $, prezzi introduttivi fino al 31 dicembre 2026 | Sì: DeepSeek V4 Pro da 0,66 $ / 1,98 $; altrimenti provider o self-hosted |
| Pesi aperti | No (a parte gpt-oss, del 2025) | No | No (a parte Gemma 4) | Sì: DeepSeek con licenza MIT, Qwen e Mistral con Apache 2.0, Llama 4 con una licenza propria |
| Punti di forza | Ecosistema, agenti, immagini e video, base utenti | Scrittura, analisi lunga, codice, connettori MCP | Integrazione Google, prezzo, immagini e video | Controllo, privacy, costo, personalizzazione |
ChatGPT (OpenAI)
ChatGPT è il LLM che ha inaugurato l'era dell'AI generativa per il grande pubblico. A settembre 2026 il modello di punta è GPT-6 Astra, uscito il 3 settembre, che OpenAI presenta come il suo modello più capace nell'uso del computer, nella programmazione e nel lavoro professionale. Dal 22 settembre sotto Astra ci sono GPT-6 Sol e GPT-6 Luna, che portano buona parte di quello che sa fare Astra in modelli più rapidi e molto meno cari. Più in basso restano la serie GPT-5.6 (Sol, Terra e Luna, di luglio) e GPT-5.5, che resta il modello veloce per le domande di tutti i giorni. Nell'app ci sono la ricerca web, la modalità agente, Deep Research, le immagini con GPT Image e i video con Sora: ChatGPT è ormai una piattaforma intera.
Punti di forza
- Ecosistema completo: agenti che navigano e compilano moduli al posto tuo, Deep Research, analisi dati, immagini e video, tutto nello stesso posto.
- Versatilità: prestazioni solide su quasi ogni compito, scrittura, codice, analisi, creatività, problem solving.
- Community: la base utenti più ampia garantisce abbondanza di prompt, tutorial e buone pratiche condivise.
- GPT personalizzati: assistenti specializzati con istruzioni e documenti propri, da condividere con colleghi e clienti.
Limitazioni
- Tende a compiacere chi scrive invece di contraddirlo, e va spinto a farlo
- I limiti del piano gratuito sono stretti, e il modello di punta si usa davvero solo dal Plus in su
- Il selettore dei modelli confonde chi comincia: Astra, la serie 5.6, la 5.5 e le versioni Pro, e la scelta sbagliata costa in qualità o in quota
- L'API del modello di punta è cara: 10 $ in ingresso e 50 $ in uscita per milione di token
Claude (Anthropic)
Claude, sviluppato da Anthropic, si distingue per la qualità della scrittura, la gestione di contesti lunghi e per essere diventato lo strumento con cui si lavora dentro al computer: Claude Code nel terminale, Claude in Chrome nel browser, Claude in Microsoft 365 (Excel compreso) e i connettori MCP, che lo collegano a Gmail, Drive, al calendario e ai propri programmi. La famiglia attuale è Claude 5: Opus 5 per la maggior parte del lavoro, Sonnet 5 per la velocità (ed è anche il modello del piano gratuito), Haiku 4.5 per i compiti semplici, e sopra Fable 5.1, il più capace, che sul Pro si usa a crediti e sul Max è compreso. Il contesto arriva a un milione di token su tutta la famiglia. Su come si usa, dall'app ai connettori a Claude Code, ho fatto un corso gratuito: Claude in pratica.
Punti di forza
- Qualità della scrittura: testi più naturali, meno formulaici e con maggiore profondità rispetto alla media dei concorrenti.
- Un milione di token di contesto: si analizzano contratti, report, codice sorgente intero e dataset in una conversazione sola, senza spezzarli.
- Codice e lavoro agentico: Claude Code è il motivo per cui molti sviluppatori lo hanno scelto: legge un progetto, lo modifica, lancia le prove e torna con il risultato.
- Connettori e MCP: un protocollo aperto per collegare il modello ai propri strumenti e ai propri dati, che gli altri fornitori hanno adottato dopo.
- Onestà: progettato per ammettere i propri limiti invece di inventare risposte, e questo riduce le allucinazioni.
Limitazioni
- Non genera immagini né video: per quelli servono ChatGPT o Gemini
- Il piano gratuito dà Sonnet 5, e Opus 5 richiede il Pro
- Fable 5.1 sul Pro si usa a crediti, quindi con parsimonia
Gemini (Google)
Gemini è il modello di Google, con il vantaggio dell'integrazione nativa con Search, Gmail, Docs e tutto Workspace. Il modello di punta è Gemini 3.1 Pro, con la finestra da un milione di token e la modalità Deep Think per i problemi difficili; i modelli Flash, arrivati alla versione 3.8 a settembre 2026, sono quelli veloci e a basso costo. I piani consumer si chiamano Google AI Plus, AI Pro (19,99 $ al mese) e AI Ultra (100 o 200 $ al mese), e comprendono anche lo spazio su Drive, la generazione di video con Veo e strumenti per chi sviluppa.
Punti di forza
- Integrazione Google: accesso diretto a Search, Maps, YouTube, Gmail e all'intera suite Workspace. Per chi lavora dentro Google è la scelta naturale.
- Multimodalità nativa: gestisce testo, immagini, audio e video, e li genera anche: immagini con Gemini Image e Imagen, video con Veo.
- Prezzo API: 3.1 Pro a 2 $ / 12 $ e 3.8 Flash a 0,75 $ / 3,75 $ per milione di token. Sono prezzi introduttivi e valgono fino al 31 dicembre 2026: dal 1° gennaio la 3.8 Flash passa a 1,50 $ / 7,50 $. A parità di fascia è il meno caro dei tre chiusi.
- Informazioni aggiornate: risposte con i risultati di Google Search dentro, senza passare da uno strumento a parte.
Limitazioni
- Nella scrittura creativa, a mio avviso, resta un gradino sotto Claude e ChatGPT
- Sopra i 200.000 token di prompt il prezzo API del Pro raddoppia
- L'esperienza è sparsa fra l'app Gemini, Workspace e AI Studio, e ci si perde a cercare dove sta cosa
I modelli aperti: Llama, DeepSeek, Qwen, Mistral
Fino al 2025 «modello aperto» voleva dire Llama. Nel 2026 il quadro è cambiato: Meta ha spostato il suo modello di punta su Muse Spark, che non è a pesi aperti; il grande Behemoth annunciato nel 2025 non è mai uscito; e l'ultimo Llama scaricabile resta Llama 4 (Scout e Maverick, aprile 2025), con una licenza propria che non è open source in senso stretto. I modelli aperti più forti oggi vengono da altre parti: DeepSeek V4 (licenza MIT, un milione di token di contesto, la versione Pro da 1.700 miliardi di parametri), Qwen 3.8 di Alibaba (Apache 2.0, dal 27B che gira su una workstation al modello da 2.400 miliardi), Mistral in Europa (Large 3 e Small 4 con Apache 2.0, e Le Chat come app) e i modelli aperti «minori» dei grandi, gpt-oss di OpenAI e Gemma 4 di Google. Attorno a loro c'è un ecosistema di strumenti (Ollama, LM Studio, vLLM) che li fa girare in locale o su un cloud privato.
Punti di forza
- Pesi aperti: si scaricano, si modificano e si ridistribuiscono. Con MIT e Apache 2.0 anche dentro a prodotti commerciali, senza chiedere il permesso.
- Privacy: in locale o sul proprio server i dati non escono. Per uno studio professionale, un ente o un'azienda con dati riservati è l'unica strada che non passa da un contratto con un fornitore estero.
- Costo: via API DeepSeek costa una frazione dei modelli chiusi; in locale, dopo l'hardware, non c'è canone.
- Personalizzazione: si adattano ai dati del proprio settore con il fine-tuning, e il modello che ne esce è proprio.
Limitazioni
- Servono competenze tecniche per installarli, aggiornarli e tenerli in piedi
- I modelli grandi (DeepSeek V4 Pro, il Qwen da 2.400 miliardi) non girano su un PC: servono server con molte GPU, quindi in pratica si usano via API o attraverso un provider
- I più forti sono cinesi. Con i pesi scaricati i dati restano in casa; con le API di DeepSeek o di Alibaba finiscono sui loro server. Chi vuole un fornitore europeo guarda Mistral
- Llama 4 ha una licenza con restrizioni, e Meta non ha detto se farà altri modelli aperti
«Sceglierne uno e ignorare gli altri è la strada per lamentarsi dell'AI. Io tengo aperti due o tre modelli e li uso per cose diverse, come si fa con gli attrezzi.»
Quale scegliere: casi d'uso
Quale userei, compito per compito:
- Scrittura contenuti marketing: Claude per la qualità del testo, ChatGPT per la versatilità. Entrambi ottimi per la creazione di contenuti con AI.
- SEO e keyword research: ChatGPT o Gemini per l'accesso ai dati web aggiornati. Vedi la guida su AI e SEO.
- Analisi documenti lunghi: oggi tutti e tre arrivano a un milione di token. Io uso Claude per contratti e report, Gemini quando il materiale è audio o video.
- Coding e sviluppo: Claude con Claude Code e ChatGPT con Codex sono i più usati; DeepSeek V4 e Qwen 3.8 per chi vuole un modello aperto che scrive codice bene.
- Ricerca e fact-checking: Gemini per Google Search dentro alle risposte, Deep Research su ChatGPT per le rassegne lunghe.
- Dati sensibili e compliance: un modello aperto in locale (Mistral, se si vuole un fornitore europeo), oppure Claude per l'approccio alla sicurezza.
- Automazione e workflow: ChatGPT per gli agenti e le app, Claude per i connettori MCP che lo collegano ai propri strumenti. Utile per l'automazione del marketing.
- Analisi dati: l'analisi dati di ChatGPT o Claude in Excel per leggere un foglio e trarne qualcosa. Vedi AI Analytics.
- Immagini e video: ChatGPT (GPT Image, Sora) o Gemini (Imagen, Veo). Claude non li fa. Vedi AI per immagini.
Consigli pratici
Come ci si lavora sul serio:
- Testare più modelli: provare lo stesso compito su ChatGPT, Claude e Gemini, e confrontare i risultati. Il modello migliore per un'esigenza si scopre così, e cambia da esigenza a esigenza.
- Investire nel prompt engineering: La qualità del prompt determina la qualità dell'output più della scelta del modello. Un prompt eccellente su un modello medio produce risultati migliori di un prompt mediocre sul modello migliore.
- Sfruttare i piani gratuiti: tutti i grandi fornitori hanno un piano gratuito, e le app di DeepSeek, Qwen e Le Chat pure. Usarli per sperimentare prima di pagare un abbonamento.
- Creare template riutilizzabili: Sviluppare prompt template specifici per le attività ricorrenti (brief editoriali, analisi SERP, report) e ottimizzarli nel tempo.
- Verificare sempre gli output: nessun LLM è infallibile. Verificare fatti, dati e citazioni resta responsabilità di chi lo usa.
- Restare aggiornati: seguire i blog ufficiali di OpenAI, Anthropic, Google DeepMind e Mistral, e le pagine dei produttori su Hugging Face per i modelli aperti. Le classifiche di terze parti vanno prese con le pinze: molte sono generate e sbagliano i nomi.
I modelli cambieranno di nuovo entro sei mesi, quindi conviene imparare quello che resta: scrivere istruzioni chiare e verificare i risultati. Quella competenza si porta da uno strumento all'altro e non scade. Se vuoi vedere come si applica al lavoro vero, ho scritto dell'AI nel marketing.
Vuoi imparare ad applicarlo davvero?
Scopri i corsi e la formazione di Federico Boggia su AI, dati e digitale.