Risorse

Classifica delle reti neurali

Modelli di IA, i prezzi dei loro fornitori e classifiche da misurazioni indipendenti. Sotto ogni tabella è scritto da dove viene il numero, chi lo ha misurato, quando e quanto ci si può fidare.

2219modelli
144sviluppatori
257fornitori di API
9fonti di dati

Ultimo ricalcolo: 7 agosto 2026

Le migliori IA

Punteggio complessivo

  1. 1 Claude Opus 5 99,44
  2. 2 Claude Opus 4.6 98,24
  3. 3 Claude Fable 5 97,34

La classifica generale: quattro capacità riunite in un unico punteggio, per confrontare i modelli nel loro insieme e non su un solo compito. È costruita su confronti alla cieca fatti da persone reali: risponde a quali risposte vengono preferite più spesso, non a quanti compiti sono stati risolti. Per un'abilità specifica, la selezione dedicata è più precisa.

su 235 modelli 99 senza differenza significativa

IA per la programmazione

Punteggio sui compiti

  1. 1 Claude Opus 4.7 59,79
  2. 2 Claude Opus 4.6 59,43
  3. 3 GPT 5.4 2026-03-05 57,49

Quanti compiti di programmazione il modello ha davvero risolto su insiemi fissi di prove — un risultato verificabile, non un'opinione. La selezione ha un secondo sguardo, basato su voti umani alla cieca: l'ordine lì è diverso, e lo scarto tra le due liste dice più di ciascuna presa da sola.

su 41 modelli

IA per il ragionamento

Punteggio sui compiti

  1. 1 GPT-5.6 Sol 71,53
  2. 2 Claude Opus 5 65,91
  3. 3 Gemini 3.1 Pro Preview 64,89

Compiti di ragionamento in cui la risposta è giusta o sbagliata: si conta la parte di problemi risolti, non le risposte che piacciono. Accanto c'è un secondo sguardo, con voti umani alla cieca. La logica è il terreno dove preferenza e problema risolto divergono di più: un ragionamento ben scritto piace anche quando la sua risposta è sbagliata.

su 91 modelli

IA per la matematica

Punteggio sui compiti

  1. 1 Claude Fable 5 74,77
  2. 2 GPT-5.6 Sol 72,1
  3. 3 Claude Opus 5 71,39

La parte di problemi matematici risolti, dal livello olimpiade al livello ricerca. Le percentuali sono più basse che nelle altre selezioni, ed è una proprietà dei problemi, non dei modelli: confrontarle con i numeri della selezione sulle conoscenze non ha senso. Il secondo sguardo viene dai voti umani alla cieca.

su 88 modelli

IA per compiti di agente

Punteggio sui compiti

  1. 1 Claude Opus 4.6 40,67
  2. 2 Claude 4.5 Opus 40,11
  3. 3 Claude Sonnet 4.5 39,89

Qui il modello non risponde a una domanda, fa il lavoro: modifica file in un sistema operativo, cerca, porta a termine compiti in un ambiente di lavoro. Per questo le percentuali sono basse anche nei modelli forti, e non si confrontano con i punteggi della selezione sulle conoscenze — è un lavoro diverso, non una forza diversa.

su 32 modelli

IA per l'inglese

Arena Score, inglese

  1. 1 Claude Opus 4.6 1.505,8
  2. 2 Claude Opus 5 1.500,16
  3. 3 Claude Fable 5 1.498,82

Confronto alla cieca di risposte in inglese — la lingua su cui la maggior parte dei modelli è stata addestrata di più. Serve una selezione a sé perché l'ordine dei modelli cambia sensibilmente da una lingua all'altra, e la classifica generale non mostra questa differenza.

su 233 modelli 99 senza differenza significativa

IA per il francese

Arena Score, francese

  1. 1 Claude Opus 5 1.522,24
  2. 2 Claude Fable 5 1.519,66
  3. 3 GPT-5.6 Terra 1.503,02

Confronto alla cieca di risposte in francese. Come negli altri tagli linguistici, la parte interessante non è tanto il punteggio quanto la posizione del modello rispetto alla sua stessa posizione nelle altre lingue: la costanza da lingua a lingua dice più di una singola riga alta.

su 185 modelli 99 senza differenza significativa

IA per lo spagnolo

Arena Score, spagnolo

  1. 1 Claude Opus 4.6 1.511,71
  2. 2 Claude Fable 5 1.504,09
  3. 3 Gemini 3.1 Pro Preview 1.479,93

Confronto alla cieca di risposte in spagnolo. Vale la pena leggerlo accanto al taglio inglese: la distanza tra le due posizioni di uno stesso modello mostra quanto perde fuori dalla lingua su cui è stato addestrato di più.

su 184 modelli 99 senza differenza significativa

Le IA più economiche

Prezzo, $ per 1M di token

  1. 1 Llama 3.2 1b Instruct 0,01
  2. 2 Ling 2.6 Flash 0,02
  3. 3 Google Gemma 2 0,02

Il prezzo dell'accesso via API per un milione di token, in dollari, secondo l'offerta più economica tra i fornitori. Ingresso e uscita sono riuniti in un unico numero: l'uscita costa di solito diverse volte di più, e ordinare i modelli solo per il prezzo di ingresso metterebbe in cima qualcosa di diverso dal più economico.

su 1508 modelli

IA multimodali

Arena Score, immagini

  1. 1 Claude Fable 5 1.334,18
  2. 2 Claude Opus 5 1.328,68
  3. 3 Gemini 3.6 Flash 1.315,75

Fino a che punto il modello capisce un'immagine insieme al testo: confronto alla cieca di risposte a richieste con un'immagine allegata. Da non confondere con la generazione di immagini — là il modello disegna, qui guarda.

su 90 modelli 84 senza differenza significativa

IA per generare immagini

Arena Score, generazione

  1. 1 GPT Image 2 1.384,81
  2. 2 Mai Image 2.5 1.256,56
  3. 3 Nano Banana 2 Lite 1.249,66

Confronto alla cieca di immagini finite: le persone scelgono la migliore senza sapere quale modello l'abbia disegnata. È un giudizio del risultato a occhio, non una verifica su consegna; per questo la differenza tra posizioni vicine il più delle volte non è statisticamente significativa.

su 33 modelli 19 senza differenza significativa

IA per generare video

Arena Score, video

  1. 1 Sora 2 Pro 1.365,62
  2. 2 Sora 2 1.337,11
  3. 3 Seedance v1.5 Pro 1.256,99

Lo stesso confronto alla cieca delle immagini, ma per i video. Qui i modelli sono dieci volte meno che nelle selezioni di testo, e le prime posizioni si staccano dal resto più nettamente — semplicemente perché i partecipanti sono pochi.

su 7 modelli 2 senza differenza significativa

IA per lo sviluppo web

Arena Score, web

  1. 1 Claude Opus 5 1.704,67
  2. 2 Kimi K3 1.675,56
  3. 3 Claude Fable 5 1.630,02

Richieste su impaginazione e applicazioni web, valutate alla cieca da persone. Si distingue dalla selezione di programmazione per la misura: là si contano i compiti risolti, qui quale risultato la gente ha preferito. Per il web è più vicino al punto, perché l'aspetto del risultato fa parte di ciò che si giudica.

su 77 modelli 70 senza differenza significativa

IA per scrivere testi

Arena Score, testo

  1. 1 Claude Opus 5 1.510,88
  2. 2 Claude Fable 5 1.498,96
  3. 3 Gemini 3 Pro 1.481,7

Testi letterari e scrittura libera, valutati alla cieca da persone: un lavoro così non ha una risposta corretta, quindi la preferenza è la misura più onesta disponibile. C'è anche un secondo sguardo, da un passaggio di compiti con punteggio; misura altro e dà un altro ordine.

su 236 modelli 99 senza differenza significativa

Le migliori IA aperte

Punteggio complessivo

  1. 1 MiMo V2.5 Pro 99,87
  2. 2 Kimi K3 99,5
  3. 3 GLM 5.1 98,05

Lo stesso punteggio complessivo della classifica generale, ma solo tra i modelli a pesi aperti — quelli che si possono scaricare ed eseguire sul proprio hardware. La selezione mostra quanto i modelli aperti restano indietro rispetto ai chiusi, e in quali compiti non restano indietro affatto.

su 106 modelli 98 senza differenza significativa

Fonti dei dati

Il catalogo, i prezzi e le valutazioni sono raccolti da fonti aperte; il diritto di ripubblicazione viene verificato sulla licenza prima che un numero arrivi sul sito. Sotto ogni tabella è indicato chi ha misurato ciò che mostra e quando. I numeri che non si possono pubblicare li usiamo solo per il riscontro e non li mostriamo sul sito.