Anthropic

Claude 3.5 Sonnet 2024-10-22

Tipo
modello linguistico
Contesto
200K token
Uscita massima
8K
Stringa per l'API
vercel_ai_gateway/anthropic/claude-3-5-sonnet-20241022

Prezzi per fornitore

Fornitore Ingresso ($ per 1M) Uscita ($ per 1M) Nei nostri dati dal
vercel_ai_gateway $3 $15 1 ago 2026
Amazon Bedrock $3 $15 2 ago 2026

È mostrata solo la tariffa base e solo i prezzi a token. Le tariffe batch, agevolate o in cache, così come i prezzi per immagine o per secondo di video, non entrano in questa tabella: non possono stare nella stessa colonna di un prezzo per milione di token.

La data nell'ultima colonna è il giorno in cui questo prezzo è entrato per la prima volta nella nostra raccolta. Il prezzo può essere più vecchio: prima di quel giorno semplicemente non lo registravamo. Da allora non è cambiato — altrimenti al suo posto ci sarebbe una riga nuova con una data nuova.

Risultati delle misurazioni

Insieme di compiti Risultato Condizioni della prova Misurato da
Arena Score, programmazione 1.342,87 1.337–1.348
Arena Score, dialogo a più turni 1.325,58 1.320–1.331
Arena Score, richieste lunghe 1.311,8 1.306–1.317
Arena Score in inglese 1.307,74 1.304–1.312
Arena Score, matematica 1.306,76 1.300–1.313
Arena Score, richieste difficili 1.305,53 1.301–1.310
Arena Score in russo 1.304,29 1.297–1.311
Arena Score in francese 1.301,79 1.280–1.323
Arena Score, generale 1.297,79 1.295–1.301
Arena Score, rispetto delle istruzioni 1.297,5 1.293–1.302
Arena Score, scrittura creativa 1.291,87 1.286–1.298
Arena Score in spagnolo 1.283,4 1.264–1.303
Arena Score, domande da esperto 1.264,39 1.255–1.274
Arena Score, riconoscimento del testo nell'immagine 1.138,75 1.120–1.158
Arena Score, comprensione degli schemi 1.132,28 1.101–1.164
Arena Score, lavoro con le immagini 1.125,48 1.118–1.133
Scrittura creativa (valutazione di Lech Mazur) 80,3 % lechmazur/writing Github repository
GeoBench — individuazione di un luogo da una foto 62 % GeoBench leaderboard
MATH, livello di difficoltà cinque 56,95 % · con impalcatura calibrata Epoch evaluations
Aider Polyglot — modifiche di codice in sei linguaggi 51,6 % · con impalcatura calibrata Aider LLM Leaderboards
CadEval — costruzione di modelli CAD tramite codice 48 % CadEval Dashboard
GPQA Diamond — domande di livello dottorale 40,4 % · con impalcatura calibrata Epoch evaluations
WeirdML — compiti insoliti di apprendimento automatico 39,97 % WeirdML Leaderboard
BALROG — ambienti di gioco 32,6 % Balrog Leaderboard
SimpleBench — domande trabocchetto 29,68 % SimpleBench Leaderboard
The Agent Company — compiti di lavoro in un ambiente d'ufficio 24 % TheAgentCompany experiment results github
Mock AIME 2024–2025 — problemi da olimpiadi 8,38 % · con impalcatura calibrata Epoch evaluations
GSO-Bench — ottimizzazione del codice 4,6 % GSO Leaderboard
Humanity’s Last Exam — domande da esperto 0 %