azure/gpt-5.2-2025-12-11| Fornitore | Ingresso ($ per 1M) | Uscita ($ per 1M) | Nei nostri dati dal |
|---|---|---|---|
| Microsoft Foundry | $1,75 | $14 | 31 lug 2026 |
| OpenAI | $1,75 | $14 | 31 lug 2026 |
È mostrata solo la tariffa base e solo i prezzi a token. Le tariffe batch, agevolate o in cache, così come i prezzi per immagine o per secondo di video, non entrano in questa tabella: non possono stare nella stessa colonna di un prezzo per milione di token.
La data nell'ultima colonna è il giorno in cui questo prezzo è entrato per la prima volta nella nostra raccolta. Il prezzo può essere più vecchio: prima di quel giorno semplicemente non lo registravamo. Da allora non è cambiato — altrimenti al suo posto ci sarebbe una riga nuova con una data nuova.
| Insieme di compiti | Risultato | Condizioni della prova | Misurato da |
|---|---|---|---|
| Mock AIME 2024–2025 — problemi da olimpiadi | 96,11 % | sforzo: none · con impalcatura calibrata | Epoch evaluations |
| GPQA Diamond — domande di livello dottorale | 88,53 % | sforzo: none · con impalcatura calibrata | Epoch evaluations |
| ARC-AGI — generalizzazione su schemi nuovi | 86,2 % | sforzo: xhigh · con impalcatura calibrata | ARC Prize Leaderboard |
| SWE-bench Verified — correzione di bug nei repository | 73,76 % | sforzo: high · con impalcatura calibrata | Epoch evaluations |
| WeirdML — compiti insoliti di apprendimento automatico | 72,2 % | sforzo: xhigh | WeirdML Leaderboard |
| FrontierMath, livelli 1–3 | 67,4 % | sforzo: xhigh | Epoch evaluations |
| Terminal-Bench — lavoro da riga di comando | 64,9 % | sforzo: medium · con impalcatura calibrata | Terminal-Bench v2 Leaderboard |
| ARC-AGI-2 | 52,91 % | sforzo: xhigh | — |
| GDPval — compiti di professioni reali | 49,7 % | sforzo: none | — |
| Problemi di scacchi | 46,34 % | sforzo: none | Epoch evaluations |
| DeepResearch Bench — ricerca approfondita | 41,12 % | sforzo: low | https://drb.futuresearch.ai/#drb autodichiarato |
| SimpleQA Verified — accuratezza fattuale | 38,9 % | sforzo: medium | Epoch evaluations |
| SimpleBench — domande trabocchetto | 34,96 % | sforzo: high | SimpleBench Leaderboard |
| APEX-Agents | 34,4 % | sforzo: xhigh | — |
| FrontierMath, livello 4 — problemi di ricerca | 31,7 % | sforzo: xhigh | Epoch evaluations |
| GSO-Bench — ottimizzazione del codice | 27,4 % | sforzo: high | GSO Leaderboard |
| Humanity’s Last Exam — domande da esperto | 24,16 % | — | — |
| Remote Labor Index — incarichi da una piattaforma di freelance | 2,5 % | sforzo: medium | — |