Lo stesso punteggio complessivo della classifica generale, ma solo tra i modelli a pesi aperti — quelli che si possono scaricare ed eseguire sul proprio hardware. La selezione mostra quanto i modelli aperti restano indietro rispetto ai chiusi, e in quali compiti non restano indietro affatto.
| # | Modello | Sviluppatore | Punteggio complessivo | Accesso$ / 1M | Uscita$ / 1M | Contestotoken | codice31 % | matematica19 % | conoscenze25 % | ragionamento25 % |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | MiMo V2.5 Pro | Xiaomi | 99,87 98–100 | $0,44 | $0,87 | 1.050K | 99,7 | 99,8 | 100 | 100 |
| 2 | Kimi K3 ≈ | Moonshot AI (Kimi) | 99,5 95–100 | $2 | $8 | 1.049K | 100 | — | 98,5 | 99,9 |
| 3 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 98,05 96–99 | $0,06 | $0,22 | 205K | 98,6 | 100 | 96,2 | 97,9 |
| 4 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 97,42 96–99 | $0,22 | $1,14 | 262K | 97,2 | 99 | 97,4 | 96,6 |
| 5 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 95,83 93–98 | $0,42 | $1,32 | 1.049K | 95,1 | 98,2 | 93,5 | 97,2 |
| 6 | MiMo V2 Pro ≈ | Xiaomi | 94,35 92–97 | $0,44 | $0,87 | 1.049K | 94,9 | 92,6 | 95,2 | 94,1 |
| 7 | Inkling ≈ | Thinking Machines Lab | 94,27 90–97 | $1,87 | $4,68 | 1.049K | 93 | 99,9 | 93,3 | 92,7 |
| 8 | DeepSeek V4 Pro ≈ | DeepSeek | 93,2 91–95 | $0,44 | $0,87 | 1.049K | 93,7 | 91,3 | 92,6 | 94,7 |
| 9 | MiniMax M3 ≈ | MiniMax | 92,88 91–95 | $0,3 | $1,2 | 1.049K | 94,1 | 91,2 | 93,4 | 92,1 |
| 10 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 92,64 91–94 | $0,6 | $3,6 | 262K | 92,6 | 92,8 | 93 | 92,2 |
| 11 | Hy3 ≈ | Tencent (Hunyuan) | 92,39 88–97 | $0,13 | $0,53 | 262K | 93 | — | 91,9 | 92,1 |
| 12 | MiMo V2.5 ≈ | Xiaomi | 92,27 90–94 | $0,14 | $0,28 | 1.050K | 93,4 | 90,6 | 92 | 92,3 |
| 13 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 92,22 91–94 | $0,5 | $3 | 1.000K | 92,6 | 93,3 | 91,2 | 92 |
| 14 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 91,9 89–95 | $0,7 | $3,1 | 203K | 93 | 94,2 | 89,7 | 91 |
| 15 | Gemma 4 31B ≈ | Google DeepMind | 91,75 88–95 | $0,14 | $0,4 | 262K | 90,3 | 96,9 | 90,1 | 91,4 |
| 16 | GLM 5 ≈ | Zhipu AI / Z.ai | 91,43 89–93 | $0,48 | $1,9 | 205K | 91,5 | 90,2 | 91,1 | 92,7 |
| 17 | Gemma 4 26B-A4B ≈ | Google DeepMind | 90,55 86–94 | $0,05 | $0,29 | 262K | 87,9 | 97 | 89,4 | 90,1 |
| 18 | MiMo V2 Omni ≈ | Xiaomi | 90,47 88–93 | $0,14 | $0,28 | 262K | 92,5 | 88,7 | 88,8 | 90,9 |
| 19 | DeepSeek V4 Flash ≈ | DeepSeek | 89,64 88–91 | $0,14 | $0,28 | 1.049K | 90,5 | 87,7 | 88,6 | 91 |
| 20 | Mistral Medium 3.5 ≈ | Mistral AI | 89,33 86–93 | $1,5 | $7,5 | 262K | 91,4 | 89,1 | 86,8 | 89,4 |
| 21 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 88,74 87–91 | $0,29 | $1,14 | 205K | 89,1 | 88,9 | 86,7 | 90,2 |
| 22 | DeepSeek V3.2 ≈ | DeepSeek | 88,52 87–90 | $0,28 | $0,4 | 164K | 88,9 | 89,7 | 86,9 | 88,7 |
| 23 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 88,49 87–90 | $0,1 | $0,1 | 262K | 88,1 | 88,6 | 88,7 | 88,8 |
| 24 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 88,32 87–90 | $1,15 | $8 | 262K | 89,9 | 88 | 87,5 | 87,4 |
| 25 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 88,26 85–91 | $0,15 | $0,8 | 205K | 90,5 | 86,6 | 84 | 91 |
| 26 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 87,84 84–91 | $0,4 | $1,6 | 262K | 87,1 | 87,2 | 89,1 | 88 |
| 27 | MiniMax M2.7 ≈ | MiniMax | 87,49 86–89 | $0,3 | $1,2 | 205K | 89,5 | 85,9 | 87,4 | 86,3 |
| 28 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 86,81 84–89 | $0,15 | $1,2 | 262K | 87,3 | 91,2 | 82,1 | 87,6 |
| 29 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 86,63 85–89 | $0,4 | $3,2 | 262K | 86,2 | 87,9 | 86,7 | 86,1 |
| 30 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 86,47 84–89 | $0,2 | $0,8 | 131K | 85,6 | 87,5 | 85,5 | 87,7 |
| 31 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 85,81 82–90 | $0,1 | $0,1 | 262K | 83,5 | 84,2 | 91 | 84,8 |
| 32 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 85,21 83–87 | $0,3 | $2,4 | 262K | 83,7 | 89 | 85 | 84,4 |
| 33 | DeepSeek V3.2 Exp ≈ | DeepSeek | 85,08 82–88 | $0,22 | $0,33 | 164K | 85,6 | 86,8 | 80,3 | 88 |
| 34 | MiMo V2 Flash ≈ | Xiaomi | 85,03 83–87 | $0,14 | $0,28 | 262K | 87,3 | 80 | 85,3 | 85,8 |
| 35 | Step 3.5 Flash ≈ | StepFun | 84,61 83–86 | $0,1 | $0,3 | 262K | 86,3 | 82,7 | 84,6 | 83,9 |
| 36 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 84,01 80–88 | $0,4 | $4 | 262K | 84,4 | 84,6 | 84 | 83,1 |
| 37 | DeepSeek V3.1 ≈ | DeepSeek | 82,99 80–86 | $0,2 | $0,7 | 164K | 81,5 | 86,2 | 80,7 | 84,7 |
| 38 | DeepSeek R1 0528 ≈ | DeepSeek | 82,79 80–86 | $0,25 | $0,25 | 164K | 84,2 | 81,9 | 79,6 | 84,9 |
| 39 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 81,28 79–83 | $0,25 | $2 | 262K | 80,3 | 82,3 | 81,5 | 81,5 |
| 40 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 80,98 76–86 | $0,21 | $0,79 | 164K | 79,8 | 80,7 | — | 82,7 |
| 41 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 80,45 78–83 | $0,05 | $0,19 | 262K | 82,1 | 79,8 | 78,4 | 80,9 |
| 42 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 78,9 75–83 | $0,15 | $0,65 | 262K | 79,6 | 76,9 | 79,6 | 78,8 |
| 43 | Nemotron 3 Super ≈ | NVIDIA | 78,9 75–83 | $0,2 | $0,8 | 1.000K | 79,6 | 76,9 | 79,6 | 78,8 |
| 44 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 77,35 74–81 | $0,6 | $2,5 | 262K | 78,3 | 80,4 | 73,7 | 77,6 |
| 45 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 77,03 75–79 | $0,11 | $0,29 | 131K | 77,5 | 80,5 | 74,2 | 76,6 |
| 46 | Qwen3 Next 80B A3B Thinking ≈ | Alibaba (Qwen) | 76,15 73–79 | $0,15 | $1,2 | 262K | 76,5 | 79,9 | 74,1 | 74,9 |
| 47 | MiniMax M2.5 ≈ | MiniMax | 74,8 73–77 | $0,3 | $1,2 | 1.000K | 73,6 | 76,5 | 75,1 | 74,7 |
| 48 | Qwen3 Coder 480B A35B ≈ | Alibaba (Qwen) | 74,8 72–77 | $1,5 | $7,5 | 262K | 81 | 72,8 | 68 | 75,3 |
| 49 | Qwen 3 235b A22B ≈ | Alibaba (Qwen) | 74,31 72–77 | $0,7 | $2,8 | 131K | 75,2 | 79,9 | 70,1 | 73,1 |
| 50 | GPT OSS 120B ≈ | OpenAI | 74,18 72–76 | $0,03 | $0,14 | 131K | 74,1 | 78,2 | 72 | 73,5 |
| 51 | Nemotron 3 Nano 30B A3B ≈ | NVIDIA | 73,19 70–76 | $0,05 | $0,2 | 262K | 74 | 74,5 | 73,9 | 70,5 |
| 52 | GLM 4.7 Flash ≈ | Zhipu AI / Z.ai | 72,86 70–76 | $0,04 | $0,3 | 203K | 74,6 | 70,8 | 72,7 | 72,3 |
| 53 | DeepSeek Reasoner ≈ | DeepSeek | 72,65 70–76 | $0,55 | $2,19 | 164K | 72,2 | 79,2 | 68 | 72,9 |
| 54 | DeepSeek Chat 0324 ≈ | DeepSeek | 72,54 71–74 | $0,2 | $0,6 | 164K | 71,5 | 74,7 | 70,8 | 73,9 |
| 55 | Kimi K2 0711 ≈ | Moonshot AI (Kimi) | 72,51 70–75 | $0,6 | $2,5 | 131K | 73,5 | 73,1 | 69,7 | 73,7 |
| 56 | Qwen3 32B ≈ | Alibaba (Qwen) | 71,71 66–77 | $0,7 | $2,8 | 131K | 69,2 | 80,6 | 72,8 | 67,1 |
| 57 | Trinity Large Preview ≈ | Arcee AI | 70,74 69–73 | — | — | 131K | 74,1 | 65,5 | 70,7 | 70,6 |
| 58 | Trinity Large Thinking ≈ | Arcee AI | 70,66 69–73 | $0,22 | $0,85 | 262K | 69,4 | 73 | 72,5 | 68,7 |
| 59 | INTELLECT 3 ≈ | Prime Intellect | 70,49 66–75 | $0,2 | $1,1 | 128K | 71,5 | 76,8 | 64,6 | 70,4 |
| 60 | MiniMax M2 ≈ | MiniMax | 70,05 65–75 | $0,3 | $1,2 | 205K | 72,6 | 69,2 | 65,1 | 72,4 |
| 61 | Llama 3.3 Nemotron Super 49B v1.5 ≈ | Meta AI | 69,28 63–75 | $0,05 | $0,25 | 131K | 68,9 | 79,6 | 64,7 | 66,6 |
| 62 | GLM 4.5V ≈ | Zhipu AI / Z.ai | 68,82 63–74 | $0,29 | $0,86 | 128K | 67,3 | 69,2 | 71,7 | 67,6 |
| 63 | MiniMax M1 ≈ | MiniMax | 68,16 66–70 | $0,13 | $1,25 | 1.000K | 69,4 | 71,8 | 63,8 | 68,2 |
| 64 | Mistral Small 3.2 ≈ | Mistral AI | 66,32 64–69 | $0,1 | $0,3 | 128K | 70,2 | 66,9 | 60 | 67,4 |
| 65 | Qwen: QwQ 32B ≈ | Alibaba (Qwen) | 66,11 64–68 | $0,18 | $0,2 | 131K | 64,1 | 71,2 | 65,6 | 65,3 |
| 66 | Qwen3 30B A3B ≈ | Alibaba (Qwen) | 65,02 63–67 | $0,09 | $0,2 | 131K | 64,9 | 70,1 | 63,6 | 62,8 |
| 67 | Llama 3.1 Nemotron Ultra 253B ≈ | Meta AI | 63,51 57–70 | $0,6 | $1,8 | 128K | 59,3 | 71,3 | — | 63 |
| 68 | Gemma 3 27B ≈ | Google DeepMind | 62,8 61–65 | $0,03 | $0,11 | 131K | 61,5 | 59,6 | 61,4 | 68,2 |
| 69 | DeepSeek V3 ≈ | DeepSeek | 61,58 59–64 | $0,27 | $1,1 | 164K | 62,1 | 59,5 | 61,9 | 62,2 |
| 70 | Command A ≈ | Cohere | 61,58 60–63 | $2,5 | $10 | 256K | 63,3 | 56,7 | 59,4 | 65,3 |
| 71 | Granite 4.1 8B ≈ | IBM | 60,2 55–66 | $0,05 | $0,1 | 131K | 59 | 60,8 | 63,1 | 58,4 |
| 72 | Olmo 3 32B Think ≈ | Allen Institute for AI | 60,01 55–65 | $0,15 | $0,5 | 66K | 60,9 | 60,7 | 58,3 | 60 |
| 73 | GPT OSS 20B ≈ | OpenAI | 56,53 53–60 | $0,01 | $0,07 | 131K | 58,4 | 61,2 | 53,3 | 53,9 |
| 74 | Llama 4 Maverick 17b 128e Instruct ≈ | Meta AI | 55,7 54–58 | $0,05 | $0,1 | 1.049K | 57,2 | 56,9 | 53,2 | 55,5 |
| 75 | Gemma 3 12B IT ≈ | Google DeepMind | 55,53 50–61 | $0,05 | $0,1 | 131K | 52,6 | 58,6 | 50,8 | 61,6 |
| 76 | Qwen2.5 72B Instruct ≈ | Alibaba (Qwen) | 52,93 51–55 | $1,4 | $5,6 | 131K | 55 | 52,7 | 50,3 | 53,1 |
| 77 | Llama 4 Scout 17B 16E Instruct ≈ | Meta AI | 52,16 50–54 | $0,05 | $0,1 | 10.000K | 53,6 | 53,6 | 49 | 52,4 |
| 78 | Llama 3.1 405B Instruct ≈ | Meta AI | 50,95 49–53 | $0,12 | $0,3 | 128K | 53,1 | 51,7 | 47,1 | 51,6 |
| 79 | Gemma 3n E4b It ≈ | Google DeepMind | 50,64 48–53 | $0,02 | $0,04 | 33K | 49,9 | 45 | 50,4 | 56,1 |
| 80 | Llama 3.1 Nemotron 70B Instruct ≈ | Meta AI | 50,63 47–54 | $0,6 | $0,6 | 128K | 50,5 | 49,9 | 49,7 | 52,2 |
| 81 | Mistral Large 2407 ≈ | Mistral AI | 49,5 48–51 | $3 | $9 | 131K | 51,6 | 47,6 | 47,8 | 50 |
| 82 | Llama 3.3 70B Instruct ≈ | Meta AI | 48,94 47–51 | $0,05 | $0,23 | 131K | 49,8 | 49,1 | 46,4 | 50,3 |
| 83 | Mistral Large ≈ | Mistral AI | 48,25 46–50 | $2 | $6 | 131K | 51,3 | 47,5 | 43,1 | 50,1 |
| 84 | Qwen2.5 Coder 32b Instruct ≈ | Alibaba (Qwen) | 48,1 44–53 | $0,06 | $0,2 | 128K | 51,4 | 45 | 45,5 | 48,9 |
| 85 | Llama 3.1 70B ≈ | Meta AI | 45,94 44–48 | $0,12 | $0,3 | 131K | 47,9 | 45,3 | 43,2 | 46,7 |
| 86 | Gemma 3 4B IT ≈ | Google DeepMind | 44,68 39–50 | $0,04 | $0,08 | 131K | 41,5 | 42,2 | 46 | 49,1 |
| 87 | Mistral: Mistral Small 3 ≈ | Mistral AI | 43,69 41–47 | $0,05 | $0,08 | 33K | 44,9 | 42,5 | 41,9 | 44,9 |
| 88 | Phi 4 ≈ | Microsoft | 42,27 40–45 | $0,06 | $0,14 | 128K | 41,7 | 43,8 | 42,1 | 41,9 |
| 89 | Google: Gemma 2 27B | Google DeepMind | 36,69 35–38 | $0,65 | $0,65 | 8K | 37,3 | 35,7 | 36,1 | 37,3 |
| 90 | Aya Expanse 32B ≈ | Cohere | 35,39 33–38 | — | — | 128K | 34,2 | 32,8 | 38,1 | 36,2 |
| 91 | Llama 3 70B Instruct ≈ | Meta AI | 35,36 34–37 | $0,12 | $0,3 | 8K | 36,3 | 37,1 | 31,8 | 36,5 |
| 92 | Ministral 8B (latest) ≈ | Mistral AI | 34,53 30–39 | $0,1 | $0,1 | 128K | 35,3 | 30 | 35,8 | 35,7 |
| 93 | Command R+ ≈ | Cohere | 33,38 30–37 | $2,5 | $10 | 128K | 32,1 | 29,9 | 36,5 | 34,5 |
| 94 | Llama 3.1 8B ≈ | Meta AI | 31,5 30–33 | $0,02 | $0,03 | 131K | 33,8 | 27,8 | 30,8 | 32,1 |
| 95 | Aya Expanse 8B ≈ | Cohere | 28,06 25–31 | — | — | 8K | 26,3 | 25,1 | 32,4 | 28 |
| 96 | Command R ≈ | Cohere | 27,79 25–31 | $0,15 | $0,6 | 128K | 28,3 | 21,9 | 29,6 | 29,8 |
| 97 | Meta: Llama 3 8B Instruct ≈ | Meta AI | 23,55 22–25 | $0,03 | $0,04 | 8K | 24,4 | 21,1 | 24,9 | 23 |
| 98 | Phi-3-medium instruct (4k) ≈ | Microsoft | 22,48 20–25 | $0,17 | $0,68 | 4K | 19,7 | 26,4 | 23,9 | 21,6 |
| 99 | Mixtral 8x7B ≈ | Mistral AI | 19,41 17–21 | $0,15 | $0,15 | 33K | 18,9 | 20,1 | 20 | 19 |
| 100 | Gemma 2 2b It ≈ | Google DeepMind | 18,17 16–20 | — | — | 128K | 15,8 | 17 | 21,6 | 18,5 |
La tabella scorre lateralmente: non tutte le colonne entrano.
Le colonne a destra sono gli addendi del punteggio, riportati a una scala comune 0–100 secondo la dispersione reale tra i modelli misurati. Sommati con i pesi indicati, danno il numero della colonna principale: da essi si vede in che cosa esattamente un modello ha superato un altro. Un trattino significa «non misurato», non zero.
Il prezzo è il più basso tra i fornitori del modello, tariffa base, senza tariffe batch o agevolate. Ingresso e uscita sono mostrati separatamente di proposito: nella maggior parte dei modelli l'uscita costa diverse volte più dell'ingresso, e il conto finale dipende da quale dei due prevale nel compito.
Il segno ≈ indica i modelli il cui intervallo di confidenza si sovrappone a quello della riga sopra. Qui ce ne sono 98 modelli — il loro ordine reciproco non è determinato dai dati disponibili.
L'intervallo di confidenza di metà dei modelli supera 4,8 punti — cioè circa 6 righe adiacenti della tabella. All'interno di un gruppo così l'ordine non è dato dai dati ma da chi ha votato questa volta; i dati reggono la differenza tra l'inizio e la fine dell'elenco, non la vicinanza tra le posizioni.