Qui il modello non risponde a una domanda, fa il lavoro: modifica file in un sistema operativo, cerca, porta a termine compiti in un ambiente di lavoro. Per questo le percentuali sono basse anche nei modelli forti, e non si confrontano con i punteggi della selezione sulle conoscenze — è un lavoro diverso, non una forza diversa.
| # | Modello | Sviluppatore | Punteggio sui compiti 0–100, corretto per copertura | Accesso$ / 1M | Uscita$ / 1M | Contestotoken | APEX-Agents | DeepResearch Bench | BALROG | Cybench | The Agent Company | Insiemimisurato |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 40,67 46,22 | $5 | $25 | 1.000K | 32,4 | 55,3 | — | 93 | — | 4 |
| 2 | Claude 4.5 Opus | Anthropic | 40,11 43,63 | $5 | $25 | 200K | 20,7 | — | 43,5 | 82 | — | 6 |
| 3 | Claude Sonnet 4.5 | Anthropic | 39,89 44,02 | $3 | $15 | 1.000K | — | 52,6 | — | 60 | — | 5 |
| 4 | Claude 4.1 Opus | Anthropic | 38,89 45,1 | $15 | $75 | 200K | — | 49,7 | — | 42 | — | 3 |
| 5 | Gemini 3.1 Pro Preview | Google DeepMind | 37,42 45,25 | $2 | $12 | 1.049K | 33,5 | — | 57 | — | — | 2 |
| 6 | Claude 4 Opus | Anthropic | 36,54 43,5 | $15 | $75 | 200K | — | 49 | — | 38 | — | 2 |
| 7 | Claude Sonnet 4.6 | Anthropic | 36,52 39,99 | $3 | $15 | 1.000K | 23,7 | 54,9 | — | — | — | 4 |
| 8 | Kimi K2.5 | Moonshot AI (Kimi) | 34,22 38,85 | $0,35 | $1,7 | 262K | 14,4 | — | — | — | — | 2 |
| 9 | Grok 4 | xAI | 32,85 34,16 | $3 | $15 | 256K | 15,2 | 47,9 | 43,6 | 43 | — | 5 |
| 10 | Gemini 3 Flash Preview | Google DeepMind | 32,82 36,05 | $0,5 | $3 | 1.049K | 24 | — | 48,1 | — | — | 2 |
| 11 | Claude 4 Sonnet | Anthropic | 32,61 33,82 | $3 | $15 | 1.000K | 9,3 | 47,8 | — | 35 | 33,1 | 5 |
| 12 | GPT 5.4 2026-03-05 | OpenAI | 32,56 35,55 | $2,5 | $15 | 1.050K | 36 | 35,1 | — | — | — | 2 |
| 13 | Gemini 3 Pro Preview | Google DeepMind | 31,72 32,79 | $2 | $12 | 1.049K | 31,5 | — | 58,1 | — | — | 4 |
| 14 | Claude Sonnet 3.7 | Anthropic | 31,58 32,58 | $3 | $15 | 200K | — | 43,6 | — | 20 | 30,9 | 4 |
| 15 | Gemini 2.5 Pro Preview 0506 | Google DeepMind | 30,34 31,1 | $1,25 | $10 | 1.049K | — | 31,9 | — | — | 30,3 | 2 |
| 16 | Claude Opus 4.8 | Anthropic | 30,14 30,42 | $5 | $25 | 1.000K | 42,5 | 50,2 | — | — | — | 4 |
| 17 | Claude Fable 5 | Anthropic | 30,07 30,55 | $10 | $50 | 1.000K | 45 | — | — | — | — | 2 |
| 18 | GPT 5.4 Mini 2026-03-17 | OpenAI | 30,01 30,43 | $0,75 | $4,5 | 272K | 24,6 | 36,3 | — | — | — | 2 |
| 19 | o3 2025-04-16 | OpenAI | 29,46 29,4 | $2 | $8 | 200K | 17,2 | 46,6 | — | — | — | 4 |
| 20 | Claude 3.5 Sonnet 2024-10-22 | Anthropic | 28,94 28,3 | $3 | $15 | 200K | — | — | 32,6 | — | 24 | 2 |
| 21 | GPT 5 2025-08-07 | OpenAI | 28,84 28,54 | $1,25 | $10 | 272K | 18,3 | 55,1 | 32,8 | — | — | 5 |
| 22 | Claude Opus 4.7 | Anthropic | 27,82 26,05 | $5 | $25 | 1.000K | 33,9 | — | — | — | — | 2 |
| 23 | Gemini 2.5 Pro | Google DeepMind | 27,75 26,54 | $1,25 | $10 | 1.049K | 6,6 | 49,7 | — | — | — | 3 |
| 24 | Gemini 3.1 Flash Lite | Google DeepMind | 27,14 24,7 | $0,25 | $1,5 | 1.049K | 13 | 36,4 | — | — | — | 2 |
| 25 | Claude Haiku 4.5 | Anthropic | 24,82 20,05 | $1 | $5 | 200K | 8,9 | — | 31,2 | — | — | 2 |
| 26 | Gemini 2.5 Flash | Google DeepMind | 23,62 17,65 | $0,3 | $2,5 | 1.049K | 1,8 | — | 33,5 | — | — | 2 |
| 27 | Llama 3.1 70B | Meta AI | 23,49 17,4 | $0,12 | $0,3 | 131K | — | — | 27,9 | — | 6,9 | 2 |
| 28 | Grok 3 | xAI | 22,69 15,8 | $3 | $15 | 131K | 2,1 | — | 29,5 | — | — | 2 |
| 29 | Kimi K2.6 | Moonshot AI (Kimi) | 20,67 11,75 | $0,22 | $1,14 | 262K | 18,9 | — | — | — | — | 2 |
| 30 | Qwen2.5 72B Instruct | Alibaba (Qwen) | 20,27 10,95 | $1,4 | $5,6 | 131K | — | — | 16,2 | — | 5,7 | 2 |
| 31 | Llama 3.1 405B Instruct | Meta AI | 18,52 7,45 | $0,12 | $0,3 | 128K | — | — | — | 7,5 | 7,4 | 2 |
| 32 | GPT-4o (2024-11-20) | OpenAI | 15,21 8,03 | $2,5 | $10 | 128K | 1,1 | — | — | 12,5 | 8,6 | 4 |
La tabella scorre lateralmente: non tutte le colonne entrano.
Le colonne a destra sono gli addendi del punteggio, riportati a una scala comune 0–100 secondo la dispersione reale tra i modelli misurati. Sommati con i pesi indicati, danno il numero della colonna principale: da essi si vede in che cosa esattamente un modello ha superato un altro. Un trattino significa «non misurato», non zero. Sono mostrati i cinque insiemi di compiti più completi su 9; gli altri sono nella scheda del modello.
La colonna «insiemi» indica su quanti insiemi di compiti è calcolato il punteggio di questo modello. Più sono, più il numero è affidabile: un punteggio su due insiemi è più disperso che su sei, e la correzione per copertura tiene conto proprio di questo.
Il prezzo è il più basso tra i fornitori del modello, tariffa base, senza tariffe batch o agevolate. Ingresso e uscita sono mostrati separatamente di proposito: nella maggior parte dei modelli l'uscita costa diverse volte più dell'ingresso, e il conto finale dipende da quale dei due prevale nel compito.
Epoch AI
— licenza CC-BY · fonte originale
По данным Epoch AI