azure/gpt-4.5-preview| Fornitore | Ingresso ($ per 1M) | Uscita ($ per 1M) | Nei nostri dati dal |
|---|---|---|---|
| Microsoft Foundry | $75 | $150 | 31 lug 2026 |
È mostrata solo la tariffa base e solo i prezzi a token. Le tariffe batch, agevolate o in cache, così come i prezzi per immagine o per secondo di video, non entrano in questa tabella: non possono stare nella stessa colonna di un prezzo per milione di token.
La data nell'ultima colonna è il giorno in cui questo prezzo è entrato per la prima volta nella nostra raccolta. Il prezzo può essere più vecchio: prima di quel giorno semplicemente non lo registravamo. Da allora non è cambiato — altrimenti al suo posto ci sarebbe una riga nuova con una data nuova.
| Insieme di compiti | Risultato | Condizioni della prova | Misurato da |
|---|---|---|---|
| Arena Score, dialogo a più turni | 1.443,92 1.430–1.457 | — | — |
| Arena Score in inglese | 1.419,49 1.412–1.427 | — | — |
| Arena Score in russo | 1.418,24 1.403–1.434 | — | — |
| Arena Score in francese | 1.418,01 1.362–1.474 | — | — |
| Arena Score, generale | 1.417,47 1.412–1.423 | — | — |
| Arena Score, matematica | 1.411,89 1.397–1.427 | — | — |
| Arena Score, richieste lunghe | 1.406 1.392–1.420 | — | — |
| Arena Score, rispetto delle istruzioni | 1.404,35 1.396–1.413 | — | — |
| Arena Score, richieste difficili | 1.403,65 1.394–1.414 | — | — |
| Arena Score, programmazione | 1.397,05 1.384–1.410 | — | — |
| Arena Score, scrittura creativa | 1.394,29 1.382–1.406 | — | — |
| Arena Score, domande da esperto | 1.393,91 1.371–1.417 | — | — |
| Arena Score, lavoro con le immagini | 1.195,13 1.183–1.207 | — | — |
| MATH, livello di difficoltà cinque | 78,63 % | · con impalcatura calibrata | Epoch evaluations |
| Scrittura creativa (valutazione di Lech Mazur) | 75,6 % | — | lechmazur/writing Github repository |
| Fiction.LiveBench — tenuta di un contesto lungo | 63,9 % | — | Fiction.live leaderboard |
| GPQA Diamond — domande di livello dottorale | 58,25 % | · con impalcatura calibrata | Epoch evaluations |
| Aider Polyglot — modifiche di codice in sei linguaggi | 44,9 % | · con impalcatura calibrata | Aider LLM Leaderboards |
| WeirdML — compiti insoliti di apprendimento automatico | 39,37 % | — | WeirdML Leaderboard |
| Mock AIME 2024–2025 — problemi da olimpiadi | 37,72 % | · con impalcatura calibrata | Epoch evaluations |
| SimpleBench — domande trabocchetto | 21,4 % | — | SimpleBench Leaderboard |
| Cybench — compiti di cybersicurezza | 17,5 % | · con impalcatura calibrata | Cybench leaderboard |
| ARC-AGI — generalizzazione su schemi nuovi | 10,3 % | · con impalcatura calibrata | ARC Prize Leaderboard |
| ARC-AGI-2 | 0,8 % | — | — |
| Humanity’s Last Exam — domande da esperto | 0,67 % | — | — |