Anthropic

Claude 4 Opus

Tipo
modello linguistico
Contesto
200K token
Uscita massima
32K
Uscito il
14 maggio 2025
Conoscenze fino a
marzo 2025
Stringa per l'API
claude-opus-4-20250514

Prezzi per fornitore

Fornitore Ingresso ($ per 1M) Uscita ($ per 1M) Nei nostri dati dal
Jiekou.AI $13,5 $67,5 31 lug 2026
NanoGPT $14,994 $75,004 31 lug 2026
302.AI $15 $75 31 lug 2026
Abacus.AI $15 $75 31 lug 2026
Amazon Bedrock $15 $75 2 ago 2026
Anthropic $15 $75 1 ago 2026
Merge Gateway $15 $75 31 lug 2026

È mostrata solo la tariffa base e solo i prezzi a token. Le tariffe batch, agevolate o in cache, così come i prezzi per immagine o per secondo di video, non entrano in questa tabella: non possono stare nella stessa colonna di un prezzo per milione di token.

La data nell'ultima colonna è il giorno in cui questo prezzo è entrato per la prima volta nella nostra raccolta. Il prezzo può essere più vecchio: prima di quel giorno semplicemente non lo registravamo. Da allora non è cambiato — altrimenti al suo posto ci sarebbe una riga nuova con una data nuova.

Risultati delle misurazioni

Insieme di compiti Risultato Condizioni della prova Misurato da
Arena Score, programmazione 1.401,8 1.395–1.409
Arena Score, richieste lunghe 1.401,79 1.395–1.409
Arena Score, dialogo a più turni 1.385,96 1.378–1.393
Arena Score in russo 1.380,6 1.369–1.392
Arena Score in inglese 1.376,69 1.371–1.382
Arena Score, richieste difficili 1.375,85 1.370–1.381
Arena Score, scrittura creativa 1.374,61 1.366–1.383
Arena Score, matematica 1.373,35 1.362–1.384
Arena Score, rispetto delle istruzioni 1.372,89 1.366–1.379
Arena Score, domande da esperto 1.371,29 1.359–1.384
Arena Score, generale 1.364,57 1.360–1.369
Arena Score in francese 1.364,46 1.339–1.390
Arena Score in spagnolo 1.350,89 1.330–1.372
Arena Score, riconoscimento del testo nell'immagine 1.179,05 1.163–1.195
Arena Score, lavoro con le immagini 1.175,62 1.163–1.189
Arena Score, comprensione degli schemi 1.175,37 1.150–1.201
MATH, livello di difficoltà cinque 85,05 % · con impalcatura calibrata Epoch evaluations
Scrittura creativa (valutazione di Lech Mazur) 83,6 % budget di ragionamento: 16K lechmazur/writing Github repository
Aider Polyglot — modifiche di codice in sei linguaggi 72 % · con impalcatura calibrata Aider LLM Leaderboards
SWE-bench Verified — correzione di bug nei repository 70,66 % · con impalcatura calibrata Epoch evaluations
GPQA Diamond — domande di livello dottorale 68,35 % budget di ragionamento: 16K · con impalcatura calibrata Epoch evaluations
Mock AIME 2024–2025 — problemi da olimpiadi 64,41 % budget di ragionamento: 27K · con impalcatura calibrata Epoch evaluations
Fiction.LiveBench — tenuta di un contesto lungo 61,1 % Fiction.live leaderboard
SimpleBench — domande trabocchetto 50,56 % budget di ragionamento: 12K SimpleBench Leaderboard
DeepResearch Bench — ricerca approfondita 49 % budget di ragionamento: 2K DeepResearchBench Leaderboard
GeoBench — individuazione di un luogo da una foto 49 % budget di ragionamento: 32K GeoBench leaderboard
WeirdML — compiti insoliti di apprendimento automatico 43,4 % budget di ragionamento: 16K WeirdML Leaderboard
Cybench — compiti di cybersicurezza 38 % · con impalcatura calibrata Cybench leaderboard
ARC-AGI — generalizzazione su schemi nuovi 35,7 % budget di ragionamento: 16K · con impalcatura calibrata ARC Prize Leaderboard
ARC-AGI-2 8,61 % budget di ragionamento: 16K
GSO-Bench — ottimizzazione del codice 6,9 % GSO Leaderboard
Humanity’s Last Exam — domande da esperto 6,22 %
CritPt — problemi di fisica 0,3 %