azure/o3-2025-04-16Il fornitore ha dichiarato obsoleto questo modello. Risponde ancora, ma è meglio non avviarci nuovi progetti.
| Fornitore | Ingresso ($ per 1M) | Uscita ($ per 1M) | Nei nostri dati dal |
|---|---|---|---|
Microsoft Foundry
azure/o3-2025-04-16
|
$2 | $8 | 31 lug 2026 |
| OpenAI | $2 | $8 | 31 lug 2026 |
Microsoft Foundry
azure/us/o3-2025-04-16
|
$2,2 | $8,8 | 31 lug 2026 |
È mostrata solo la tariffa base e solo i prezzi a token. Le tariffe batch, agevolate o in cache, così come i prezzi per immagine o per secondo di video, non entrano in questa tabella: non possono stare nella stessa colonna di un prezzo per milione di token.
Uno stesso fornitore compare più volte se vende questo modello con identificatori diversi e a prezzi diversi — per esempio con precisione dei pesi diversa. L'identificatore è indicato accanto al nome. Le offerte identiche arrivate da due fonti con grafie diverse sono unite in un'unica riga.
La data nell'ultima colonna è il giorno in cui questo prezzo è entrato per la prima volta nella nostra raccolta. Il prezzo può essere più vecchio: prima di quel giorno semplicemente non lo registravamo. Da allora non è cambiato — altrimenti al suo posto ci sarebbe una riga nuova con una data nuova.
| Insieme di compiti | Risultato | Condizioni della prova | Misurato da |
|---|---|---|---|
| Arena Score in francese | 1.445,04 1.422–1.468 | — | — |
| Arena Score, matematica | 1.424,48 1.415–1.434 | — | — |
| Arena Score in inglese | 1.414,47 1.410–1.419 | — | — |
| Arena Score, generale | 1.409,5 1.406–1.413 | — | — |
| Arena Score in russo | 1.408,32 1.399–1.418 | — | — |
| Arena Score, programmazione | 1.408,19 1.402–1.414 | — | — |
| Arena Score, dialogo a più turni | 1.404,93 1.398–1.412 | — | — |
| Arena Score, richieste difficili | 1.401,88 1.397–1.407 | — | — |
| Arena Score, domande da esperto | 1.400,18 1.389–1.412 | — | — |
| Arena Score in spagnolo | 1.384,08 1.365–1.403 | — | — |
| Arena Score, richieste lunghe | 1.370,54 1.364–1.377 | — | — |
| Arena Score, rispetto delle istruzioni | 1.367,67 1.362–1.373 | — | — |
| Arena Score, scrittura creativa | 1.359,4 1.352–1.367 | — | — |
| Arena Score, comprensione degli schemi | 1.218,28 1.206–1.230 | — | — |
| Arena Score, riconoscimento del testo nell'immagine | 1.218,19 1.210–1.226 | — | — |
| Arena Score, lavoro con le immagini | 1.215,41 1.209–1.222 | — | — |
| MATH, livello di difficoltà cinque | 97,77 % | sforzo: high · con impalcatura calibrata | Epoch evaluations |
| Fiction.LiveBench — tenuta di un contesto lungo | 88,9 % | sforzo: medium | Fiction.live leaderboard |
| Scrittura creativa (valutazione di Lech Mazur) | 83,9 % | sforzo: medium | lechmazur/writing Github repository |
| Mock AIME 2024–2025 — problemi da olimpiadi | 83,87 % | sforzo: low · con impalcatura calibrata | Epoch evaluations |
| Aider Polyglot — modifiche di codice in sei linguaggi | 81,3 % | sforzo: medium · con impalcatura calibrata | Aider LLM Leaderboards |
| GPQA Diamond — domande di livello dottorale | 75,76 % | sforzo: low · con impalcatura calibrata | Epoch evaluations |
| CadEval — costruzione di modelli CAD tramite codice | 74 % | sforzo: medium | CadEval Dashboard |
| GeoBench — individuazione di un luogo da una foto | 74 % | sforzo: high | GeoBench leaderboard |
| SWE-bench Verified — correzione di bug nei repository | 62,32 % | sforzo: medium · con impalcatura calibrata | Epoch evaluations |
| ARC-AGI — generalizzazione su schemi nuovi | 60,8 % | sforzo: high · con impalcatura calibrata | ARC Prize Leaderboard |
| SimpleQA Verified — accuratezza fattuale | 53 % | sforzo: high | Epoch evaluations |
| WeirdML — compiti insoliti di apprendimento automatico | 52,42 % | sforzo: high | WeirdML Leaderboard |
| DeepResearch Bench — ricerca approfondita | 46,6 % | sforzo: medium | DeepResearchBench Leaderboard |
| SimpleBench — domande trabocchetto | 43,72 % | sforzo: high | SimpleBench Leaderboard |
| GDPval — compiti di professioni reali | 30,8 % | sforzo: medium | — |
| Problemi di scacchi | 23,19 % | sforzo: low | Epoch evaluations |
| OSWorld — lavoro in un sistema operativo, prima versione | 23 % | sforzo: medium · con impalcatura calibrata | OS World Website |
| APEX-Agents | 17,2 % | sforzo: high | — |
| Humanity’s Last Exam — domande da esperto | 16,3 % | sforzo: high | — |
| GSO-Bench — ottimizzazione del codice | 8,8 % | sforzo: high | GSO Leaderboard |
| ARC-AGI-2 | 6,53 % | sforzo: high | — |
| CritPt — problemi di fisica | 1,4 % | sforzo: high | — |