Le migliori IA
Punteggio complessivo
-
1
Claude Opus 5
99,44
-
2
Claude Opus 4.6
98,24
-
3
Claude Fable 5
97,34
La classifica generale: quattro capacità riunite in un unico punteggio, per confrontare i modelli nel loro insieme e non su un solo compito. È costruita su confronti alla cieca fatti da persone reali: risponde a quali risposte vengono preferite più spesso, non a quanti compiti sono stati risolti. Per un'abilità specifica, la selezione dedicata è più precisa.
su 235 modelli
99 senza differenza significativa
IA per la programmazione
Punteggio sui compiti
-
1
Claude Opus 4.7
59,79
-
2
Claude Opus 4.6
59,43
-
3
GPT 5.4 2026-03-05
57,49
Quanti compiti di programmazione il modello ha davvero risolto su insiemi fissi di prove — un risultato verificabile, non un'opinione. La selezione ha un secondo sguardo, basato su voti umani alla cieca: l'ordine lì è diverso, e lo scarto tra le due liste dice più di ciascuna presa da sola.
su 41 modelli
IA per il ragionamento
Punteggio sui compiti
-
1
GPT-5.6 Sol
71,53
-
2
Claude Opus 5
65,91
-
3
Gemini 3.1 Pro Preview
64,89
Compiti di ragionamento in cui la risposta è giusta o sbagliata: si conta la parte di problemi risolti, non le risposte che piacciono. Accanto c'è un secondo sguardo, con voti umani alla cieca. La logica è il terreno dove preferenza e problema risolto divergono di più: un ragionamento ben scritto piace anche quando la sua risposta è sbagliata.
su 91 modelli
IA per ampiezza di conoscenze
Punteggio sui compiti
-
1
Gemini 3 Flash Preview
55,84
-
2
Qwen3.6 Max Preview
55,18
-
3
GPT-5.6 Sol
54,72
Una prova di conoscenze fattuali su domande che hanno un'unica risposta corretta. Si distingue dalle selezioni vicine perché qui il modello non ragiona e non scrive codice — ricorda. Il secondo sguardo sullo stesso tema viene dai voti umani alla cieca.
su 79 modelli
IA per la matematica
Punteggio sui compiti
-
1
Claude Fable 5
74,77
-
2
GPT-5.6 Sol
72,1
-
3
Claude Opus 5
71,39
La parte di problemi matematici risolti, dal livello olimpiade al livello ricerca. Le percentuali sono più basse che nelle altre selezioni, ed è una proprietà dei problemi, non dei modelli: confrontarle con i numeri della selezione sulle conoscenze non ha senso. Il secondo sguardo viene dai voti umani alla cieca.
su 88 modelli
IA per compiti di agente
Punteggio sui compiti
-
1
Claude Opus 4.6
40,67
-
2
Claude 4.5 Opus
40,11
-
3
Claude Sonnet 4.5
39,89
Qui il modello non risponde a una domanda, fa il lavoro: modifica file in un sistema operativo, cerca, porta a termine compiti in un ambiente di lavoro. Per questo le percentuali sono basse anche nei modelli forti, e non si confrontano con i punteggi della selezione sulle conoscenze — è un lavoro diverso, non una forza diversa.
su 32 modelli
IA per l'inglese
Arena Score, inglese
-
1
Claude Opus 4.6
1.505,8
-
2
Claude Opus 5
1.500,16
-
3
Claude Fable 5
1.498,82
Confronto alla cieca di risposte in inglese — la lingua su cui la maggior parte dei modelli è stata addestrata di più. Serve una selezione a sé perché l'ordine dei modelli cambia sensibilmente da una lingua all'altra, e la classifica generale non mostra questa differenza.
su 233 modelli
99 senza differenza significativa
IA per il francese
Arena Score, francese
-
1
Claude Opus 5
1.522,24
-
2
Claude Fable 5
1.519,66
-
3
GPT-5.6 Terra
1.503,02
Confronto alla cieca di risposte in francese. Come negli altri tagli linguistici, la parte interessante non è tanto il punteggio quanto la posizione del modello rispetto alla sua stessa posizione nelle altre lingue: la costanza da lingua a lingua dice più di una singola riga alta.
su 185 modelli
99 senza differenza significativa
IA per lo spagnolo
Arena Score, spagnolo
-
1
Claude Opus 4.6
1.511,71
-
2
Claude Fable 5
1.504,09
-
3
Gemini 3.1 Pro Preview
1.479,93
Confronto alla cieca di risposte in spagnolo. Vale la pena leggerlo accanto al taglio inglese: la distanza tra le due posizioni di uno stesso modello mostra quanto perde fuori dalla lingua su cui è stato addestrato di più.
su 184 modelli
99 senza differenza significativa
Le IA più economiche
Prezzo, $ per 1M di token
-
1
Llama 3.2 1b Instruct
0,01
-
2
Ling 2.6 Flash
0,02
-
3
Google Gemma 2
0,02
Il prezzo dell'accesso via API per un milione di token, in dollari, secondo l'offerta più economica tra i fornitori. Ingresso e uscita sono riuniti in un unico numero: l'uscita costa di solito diverse volte di più, e ordinare i modelli solo per il prezzo di ingresso metterebbe in cima qualcosa di diverso dal più economico.
su 1508 modelli
IA con contesto lungo
Contesto, token
-
1
Qwen Long 10M
10.000.000
-
2
Llama 4 Scout 17B 16E Instruct
10.000.000
-
3
Llama 4 Scout 17B 128e Instruct
10.000.000
Quanto testo il modello accetta in una singola richiesta. Il numero è dichiarato dallo sviluppatore e per ora non possiamo verificarlo: su finestre lunghe la qualità di solito cala molto prima del limite. Questa selezione risponde quindi se il testo ci starà — non se il modello lo capirà.
su 1666 modelli
IA multimodali
Arena Score, immagini
-
1
Claude Fable 5
1.334,18
-
2
Claude Opus 5
1.328,68
-
3
Gemini 3.6 Flash
1.315,75
Fino a che punto il modello capisce un'immagine insieme al testo: confronto alla cieca di risposte a richieste con un'immagine allegata. Da non confondere con la generazione di immagini — là il modello disegna, qui guarda.
su 90 modelli
84 senza differenza significativa
IA per generare immagini
Arena Score, generazione
-
1
GPT Image 2
1.384,81
-
2
Mai Image 2.5
1.256,56
-
3
Nano Banana 2 Lite
1.249,66
Confronto alla cieca di immagini finite: le persone scelgono la migliore senza sapere quale modello l'abbia disegnata. È un giudizio del risultato a occhio, non una verifica su consegna; per questo la differenza tra posizioni vicine il più delle volte non è statisticamente significativa.
su 33 modelli
19 senza differenza significativa
IA per generare video
Arena Score, video
-
1
Sora 2 Pro
1.365,62
-
2
Sora 2
1.337,11
-
3
Seedance v1.5 Pro
1.256,99
Lo stesso confronto alla cieca delle immagini, ma per i video. Qui i modelli sono dieci volte meno che nelle selezioni di testo, e le prime posizioni si staccano dal resto più nettamente — semplicemente perché i partecipanti sono pochi.
su 7 modelli
2 senza differenza significativa
IA per lo sviluppo web
Arena Score, web
-
1
Claude Opus 5
1.704,67
-
2
Kimi K3
1.675,56
-
3
Claude Fable 5
1.630,02
Richieste su impaginazione e applicazioni web, valutate alla cieca da persone. Si distingue dalla selezione di programmazione per la misura: là si contano i compiti risolti, qui quale risultato la gente ha preferito. Per il web è più vicino al punto, perché l'aspetto del risultato fa parte di ciò che si giudica.
su 77 modelli
70 senza differenza significativa
IA per scrivere testi
Arena Score, testo
-
1
Claude Opus 5
1.510,88
-
2
Claude Fable 5
1.498,96
-
3
Gemini 3 Pro
1.481,7
Testi letterari e scrittura libera, valutati alla cieca da persone: un lavoro così non ha una risposta corretta, quindi la preferenza è la misura più onesta disponibile. C'è anche un secondo sguardo, da un passaggio di compiti con punteggio; misura altro e dà un altro ordine.
su 236 modelli
99 senza differenza significativa
Le migliori IA aperte
Punteggio complessivo
-
1
MiMo V2.5 Pro
99,87
-
2
Kimi K3
99,5
-
3
GLM 5.1
98,05
Lo stesso punteggio complessivo della classifica generale, ma solo tra i modelli a pesi aperti — quelli che si possono scaricare ed eseguire sul proprio hardware. La selezione mostra quanto i modelli aperti restano indietro rispetto ai chiusi, e in quali compiti non restano indietro affatto.
su 106 modelli
98 senza differenza significativa