grok-4-0709| Fornitore | Ingresso ($ per 1M) | Uscita ($ per 1M) | Nei nostri dati dal |
|---|---|---|---|
| Jiekou.AI | $2,7 | $13,5 | 31 lug 2026 |
| Abacus.AI | $3 | $15 | 31 lug 2026 |
| xAI | $3 | $15 | 31 lug 2026 |
È mostrata solo la tariffa base e solo i prezzi a token. Le tariffe batch, agevolate o in cache, così come i prezzi per immagine o per secondo di video, non entrano in questa tabella: non possono stare nella stessa colonna di un prezzo per milione di token.
La data nell'ultima colonna è il giorno in cui questo prezzo è entrato per la prima volta nella nostra raccolta. Il prezzo può essere più vecchio: prima di quel giorno semplicemente non lo registravamo. Da allora non è cambiato — altrimenti al suo posto ci sarebbe una riga nuova con una data nuova.
| Insieme di compiti | Risultato | Condizioni della prova | Misurato da |
|---|---|---|---|
| Arena Score in francese | 1.425,25 1.399–1.452 | — | — |
| Arena Score, matematica | 1.424,24 1.412–1.437 | — | — |
| Arena Score in inglese | 1.418,4 1.413–1.423 | — | — |
| Arena Score, domande da esperto | 1.417,67 1.404–1.431 | — | — |
| Arena Score, dialogo a più turni | 1.415,59 1.408–1.423 | — | — |
| Arena Score in spagnolo | 1.413,5 1.394–1.433 | — | — |
| Arena Score in russo | 1.412,96 1.401–1.425 | — | — |
| Arena Score, richieste lunghe | 1.410,19 1.404–1.417 | — | — |
| Arena Score, generale | 1.409,91 1.406–1.414 | — | — |
| Arena Score, programmazione | 1.408,98 1.402–1.416 | — | — |
| Arena Score, richieste difficili | 1.408,55 1.404–1.414 | — | — |
| Arena Score, scrittura creativa | 1.398,43 1.390–1.407 | — | — |
| Arena Score, rispetto delle istruzioni | 1.387,31 1.381–1.393 | — | — |
| Arena Score, lavoro con le immagini | 1.208,77 1.201–1.216 | — | — |
| Arena Score, comprensione degli schemi | 1.203,03 1.190–1.216 | — | — |
| Arena Score, riconoscimento del testo nell'immagine | 1.194,52 1.186–1.203 | — | — |
| Fiction.LiveBench — tenuta di un contesto lungo | 94,4 % | — | Fiction.live leaderboard |
| Mock AIME 2024–2025 — problemi da olimpiadi | 83,98 % | · con impalcatura calibrata | Epoch evaluations |
| GPQA Diamond — domande di livello dottorale | 82,67 % | · con impalcatura calibrata | Epoch evaluations |
| Aider Polyglot — modifiche di codice in sei linguaggi | 79,6 % | · con impalcatura calibrata | Aider LLM Leaderboards |
| Scrittura creativa (valutazione di Lech Mazur) | 76,9 % | — | lechmazur/writing Github repository |
| ARC-AGI — generalizzazione su schemi nuovi | 66,67 % | · con impalcatura calibrata | — |
| SimpleBench — domande trabocchetto | 52,6 % | — | SimpleBench Leaderboard |
| SimpleQA Verified — accuratezza fattuale | 47,9 % | — | Epoch evaluations |
| DeepResearch Bench — ricerca approfondita | 47,9 % | — | DeepResearchBench Leaderboard |
| WeirdML — compiti insoliti di apprendimento automatico | 45,73 % | — | WeirdML Leaderboard |
| GeoBench — individuazione di un luogo da una foto | 45 % | — | GeoBench leaderboard |
| BALROG — ambienti di gioco | 43,6 % | — | Balrog Leaderboard |
| Cybench — compiti di cybersicurezza | 43 % | · con impalcatura calibrata | Grok 4 Model Card autodichiarato |
| Terminal-Bench — lavoro da riga di comando | 27,2 % | · con impalcatura calibrata | Terminal-Bench v2 Leaderboard |
| Problemi di scacchi | 24,24 % | — | Epoch evaluations |
| GDPval — compiti di professioni reali | 21,1 % | sforzo: high | — |
| ARC-AGI-2 | 15,98 % | — | — |
| APEX-Agents | 15,2 % | — | — |