Classifica IA

Le migliori IA per compiti di agente

Qui il modello non risponde a una domanda, fa il lavoro: modifica file in un sistema operativo, cerca, porta a termine compiti in un ambiente di lavoro. Per questo le percentuali sono basse anche nei modelli forti, e non si confrontano con i punteggi della selezione sulle conoscenze — è un lavoro diverso, non una forza diversa.

32 modelli nella tabella
32 considerati nel calcolo
9 giugno 2026 uscita del modello più recente qui
7 agosto 2026 ultimo ricalcolo
# Modello Sviluppatore Punteggio sui compiti 0–100, corretto per copertura Accesso$ / 1M Uscita$ / 1M Contestotoken APEX-Agents DeepResearch Bench BALROG Cybench The Agent Company Insiemimisurato
1 Claude Opus 4.6 Anthropic 40,67 46,22 $5 $25 1.000K 32,4 55,3 93 4
2 Claude 4.5 Opus Anthropic 40,11 43,63 $5 $25 200K 20,7 43,5 82 6
3 Claude Sonnet 4.5 Anthropic 39,89 44,02 $3 $15 1.000K 52,6 60 5
4 Claude 4.1 Opus Anthropic 38,89 45,1 $15 $75 200K 49,7 42 3
5 Gemini 3.1 Pro Preview Google DeepMind 37,42 45,25 $2 $12 1.049K 33,5 57 2
6 Claude 4 Opus Anthropic 36,54 43,5 $15 $75 200K 49 38 2
7 Claude Sonnet 4.6 Anthropic 36,52 39,99 $3 $15 1.000K 23,7 54,9 4
8 Kimi K2.5 Moonshot AI (Kimi) 34,22 38,85 $0,35 $1,7 262K 14,4 2
9 Grok 4 xAI 32,85 34,16 $3 $15 256K 15,2 47,9 43,6 43 5
10 Gemini 3 Flash Preview Google DeepMind 32,82 36,05 $0,5 $3 1.049K 24 48,1 2
11 Claude 4 Sonnet Anthropic 32,61 33,82 $3 $15 1.000K 9,3 47,8 35 33,1 5
12 GPT 5.4 2026-03-05 OpenAI 32,56 35,55 $2,5 $15 1.050K 36 35,1 2
13 Gemini 3 Pro Preview Google DeepMind 31,72 32,79 $2 $12 1.049K 31,5 58,1 4
14 Claude Sonnet 3.7 Anthropic 31,58 32,58 $3 $15 200K 43,6 20 30,9 4
15 Gemini 2.5 Pro Preview 0506 Google DeepMind 30,34 31,1 $1,25 $10 1.049K 31,9 30,3 2
16 Claude Opus 4.8 Anthropic 30,14 30,42 $5 $25 1.000K 42,5 50,2 4
17 Claude Fable 5 Anthropic 30,07 30,55 $10 $50 1.000K 45 2
18 GPT 5.4 Mini 2026-03-17 OpenAI 30,01 30,43 $0,75 $4,5 272K 24,6 36,3 2
19 o3 2025-04-16 OpenAI 29,46 29,4 $2 $8 200K 17,2 46,6 4
20 Claude 3.5 Sonnet 2024-10-22 Anthropic 28,94 28,3 $3 $15 200K 32,6 24 2
21 GPT 5 2025-08-07 OpenAI 28,84 28,54 $1,25 $10 272K 18,3 55,1 32,8 5
22 Claude Opus 4.7 Anthropic 27,82 26,05 $5 $25 1.000K 33,9 2
23 Gemini 2.5 Pro Google DeepMind 27,75 26,54 $1,25 $10 1.049K 6,6 49,7 3
24 Gemini 3.1 Flash Lite Google DeepMind 27,14 24,7 $0,25 $1,5 1.049K 13 36,4 2
25 Claude Haiku 4.5 Anthropic 24,82 20,05 $1 $5 200K 8,9 31,2 2
26 Gemini 2.5 Flash Google DeepMind 23,62 17,65 $0,3 $2,5 1.049K 1,8 33,5 2
27 Llama 3.1 70B Meta AI 23,49 17,4 $0,12 $0,3 131K 27,9 6,9 2
28 Grok 3 xAI 22,69 15,8 $3 $15 131K 2,1 29,5 2
29 Kimi K2.6 Moonshot AI (Kimi) 20,67 11,75 $0,22 $1,14 262K 18,9 2
30 Qwen2.5 72B Instruct Alibaba (Qwen) 20,27 10,95 $1,4 $5,6 131K 16,2 5,7 2
31 Llama 3.1 405B Instruct Meta AI 18,52 7,45 $0,12 $0,3 128K 7,5 7,4 2
32 GPT-4o (2024-11-20) OpenAI 15,21 8,03 $2,5 $10 128K 1,1 12,5 8,6 4

La tabella scorre lateralmente: non tutte le colonne entrano.

Le colonne a destra sono gli addendi del punteggio, riportati a una scala comune 0–100 secondo la dispersione reale tra i modelli misurati. Sommati con i pesi indicati, danno il numero della colonna principale: da essi si vede in che cosa esattamente un modello ha superato un altro. Un trattino significa «non misurato», non zero. Sono mostrati i cinque insiemi di compiti più completi su 9; gli altri sono nella scheda del modello.

Che cosa verifica ogni insieme di compiti
APEX-Agents
modelli misurati: 47
BALROG
ambienti di gioco modelli misurati: 22
Cybench
compiti di cybersicurezza modelli misurati: 19
DeepResearch Bench
ricerca approfondita modelli misurati: 22
GDPval
compiti di professioni reali modelli misurati: 11
OSWorld
lavoro in un sistema operativo, prima versione modelli misurati: 8
OSWorld 2.0
lavoro in un sistema operativo modelli misurati: 6
Remote Labor Index
incarichi da una piattaforma di freelance modelli misurati: 10
The Agent Company
compiti di lavoro in un ambiente d'ufficio modelli misurati: 13

La colonna «insiemi» indica su quanti insiemi di compiti è calcolato il punteggio di questo modello. Più sono, più il numero è affidabile: un punteggio su due insiemi è più disperso che su sei, e la correzione per copertura tiene conto proprio di questo.

Il prezzo è il più basso tra i fornitori del modello, tariffa base, senza tariffe batch o agevolate. Ingresso e uscita sono mostrati separatamente di proposito: nella maggior parte dei modelli l'uscita costa diverse volte più dell'ingresso, e il conto finale dipende da quale dei due prevale nel compito.

Epoch AI — licenza CC-BY · fonte originale
По данным Epoch AI