Mistral Large 4 in anteprima: l'IA europea da 1.000 miliardi di parametri

Mistral Large 4 in anteprima via API, 1.000 miliardi di parametri. Pesi promessi a fine ottobre, primo test indipendente sopra la media.

07 ottobre 2026 15:55
Mistral Large 4 in anteprima: l'IA europea da 1.000 miliardi di parametri - Mistral Large 4
Mistral Large 4
Condividi

Mistral AI ha aperto il 6 ottobre un'anteprima pubblica di Mistral Large 4, il modello più grande mai sviluppato dalla società francese. Ha circa 1.000 miliardi di parametri complessivi, accetta in ingresso testo e immagini e si può già usare via API su Mistral Studio, al prezzo di 1,36 dollari per milione di token in ingresso e 4,18 in uscita. I pesi, cioè i valori numerici che permettono di scaricare ed eseguire il modello in proprio, non sono ancora disponibili. L'azienda li ha promessi entro la fine di ottobre.

Quasi tutti i numeri sulle prestazioni vengono da Mistral. La prima misura indipendente è quella di Artificial Analysis, che assegna alla versione preview un punteggio di 38 nel suo Intelligence Index, contro una mediana di 26 tra i modelli di fascia di prezzo comparabile. Lo stesso test registra una velocità di 116 token al secondo e una verbosità molto alta, con circa 200 milioni di token generati per completare le prove, a fronte di una mediana di 81 milioni.

Come è costruito e cosa dicono i benchmark dell'azienda

Large 4 usa un'architettura Mixture of Experts, in cui la rete è divisa in tanti sottomodelli specializzati e per ogni token ne viene attivata solo una parte. Secondo la documentazione tecnica i parametri totali sono 1.050 miliardi, quelli attivi per token 49 miliardi, a cui si aggiunge un encoder visivo da 1,6 miliardi. La finestra di contesto dichiarata è di 1 milione di token, mentre Artificial Analysis ne riporta circa 524.000 per la versione che ha misurato. Mistral scrive di aver addestrato il modello da zero su 3.800 GPU NVIDIA Grace Blackwell nei propri data center europei, con dati in oltre 160 lingue.

Sul fronte della programmazione l'azienda indica il 61,7% su DeepSWE v1.1 e il 28,3% su Terminal-Bench 4, due prove in cui il modello deve risolvere problemi reali di codice e lavorare da riga di comando. In una valutazione umana in cieco condotta con Surge AI, con voti da 1 a 5, la preview ha ottenuto 3,74 e si è piazzata seconda su cinque modelli, dietro Claude Opus 5 (4,22). Nell'indice aggregato sugli agenti di programmazione il 49,8% dichiarato lo collocherebbe davanti a DeepSeek V4 Pro e Qwen3.8 Max.

La parte su cui Mistral insiste di più è la sicurezza informatica. Il modello risolverebbe il 93% di Cybench, un insieme di 40 esercizi presi da competizioni di hacking etico, e otterrebbe l'82% in una prova dell'Artificial Analysis Cyber Index che chiede di riprodurre e correggere una vulnerabilità reale in software open source. Nello stesso test, sempre secondo l'annuncio, modelli chiusi come Claude Opus 5.5 e GPT-6 Astra restano vicini allo zero perché rifiutano il compito.

Cosa manca perché diventi un modello aperto davvero

Finché i pesi non escono, Large 4 resta un servizio cloud. Artificial Analysis lo classifica per ora come modello proprietario, proprio perché non è scaricabile. Nel frattempo Mistral lo sta sottoponendo a red teaming, cioè ad attacchi simulati per scoprirne i punti deboli, insieme ad aziende di sicurezza, partner selezionati e autorità statali, che ricevono una versione con moderazione ridotta. Con i pesi la società promette i dettagli dell'architettura, altri benchmark e la metodologia di post-addestramento.

La possibilità di eseguire il modello su server propri è l'argomento con cui Mistral si rivolge a chi lavora in sicurezza informatica, finanza e pubblica amministrazione. Sul rischio d'abuso l'azienda dichiara un tasso di rifiuto delle richieste offensive più alto di tutti i modelli aperti testati su JailbreakBench, StrongREJECT e AgentHarm, e una resistenza al 93,3% degli attacchi sul benchmark B3 di Lakera. Sono dati interni e non ancora replicati.

Mistral precisa infine che la fase di apprendimento per rinforzo, la tecnica che premia il modello quando porta a termine un compito, è ancora in corso, quindi la versione finale potrebbe comportarsi diversamente dalla preview. Il progetto rientra nel piano finanziato dal round di Serie D da 3 miliardi di euro chiuso dalla società, e secondo l'azienda sarà la base di una nuova serie di modelli specializzati per settore.

Segui Tech CuE