xAI

Grok 4

Tipo
modello linguistico
Contesto
256K token
Uscita massima
16K
Uscito il
9 luglio 2025
Stringa per l'API
grok-4-0709

Prezzi per fornitore

Fornitore Ingresso ($ per 1M) Uscita ($ per 1M) Nei nostri dati dal
Jiekou.AI $2,7 $13,5 31 lug 2026
Abacus.AI $3 $15 31 lug 2026
xAI $3 $15 31 lug 2026

È mostrata solo la tariffa base e solo i prezzi a token. Le tariffe batch, agevolate o in cache, così come i prezzi per immagine o per secondo di video, non entrano in questa tabella: non possono stare nella stessa colonna di un prezzo per milione di token.

La data nell'ultima colonna è il giorno in cui questo prezzo è entrato per la prima volta nella nostra raccolta. Il prezzo può essere più vecchio: prima di quel giorno semplicemente non lo registravamo. Da allora non è cambiato — altrimenti al suo posto ci sarebbe una riga nuova con una data nuova.

Risultati delle misurazioni

Insieme di compiti Risultato Condizioni della prova Misurato da
Arena Score in francese 1.425,25 1.399–1.452
Arena Score, matematica 1.424,24 1.412–1.437
Arena Score in inglese 1.418,4 1.413–1.423
Arena Score, domande da esperto 1.417,67 1.404–1.431
Arena Score, dialogo a più turni 1.415,59 1.408–1.423
Arena Score in spagnolo 1.413,5 1.394–1.433
Arena Score in russo 1.412,96 1.401–1.425
Arena Score, richieste lunghe 1.410,19 1.404–1.417
Arena Score, generale 1.409,91 1.406–1.414
Arena Score, programmazione 1.408,98 1.402–1.416
Arena Score, richieste difficili 1.408,55 1.404–1.414
Arena Score, scrittura creativa 1.398,43 1.390–1.407
Arena Score, rispetto delle istruzioni 1.387,31 1.381–1.393
Arena Score, lavoro con le immagini 1.208,77 1.201–1.216
Arena Score, comprensione degli schemi 1.203,03 1.190–1.216
Arena Score, riconoscimento del testo nell'immagine 1.194,52 1.186–1.203
Fiction.LiveBench — tenuta di un contesto lungo 94,4 % Fiction.live leaderboard
Mock AIME 2024–2025 — problemi da olimpiadi 83,98 % · con impalcatura calibrata Epoch evaluations
GPQA Diamond — domande di livello dottorale 82,67 % · con impalcatura calibrata Epoch evaluations
Aider Polyglot — modifiche di codice in sei linguaggi 79,6 % · con impalcatura calibrata Aider LLM Leaderboards
Scrittura creativa (valutazione di Lech Mazur) 76,9 % lechmazur/writing Github repository
ARC-AGI — generalizzazione su schemi nuovi 66,67 % · con impalcatura calibrata
SimpleBench — domande trabocchetto 52,6 % SimpleBench Leaderboard
SimpleQA Verified — accuratezza fattuale 47,9 % Epoch evaluations
DeepResearch Bench — ricerca approfondita 47,9 % DeepResearchBench Leaderboard
WeirdML — compiti insoliti di apprendimento automatico 45,73 % WeirdML Leaderboard
GeoBench — individuazione di un luogo da una foto 45 % GeoBench leaderboard
BALROG — ambienti di gioco 43,6 % Balrog Leaderboard
Cybench — compiti di cybersicurezza 43 % · con impalcatura calibrata Grok 4 Model Card autodichiarato
Terminal-Bench — lavoro da riga di comando 27,2 % · con impalcatura calibrata Terminal-Bench v2 Leaderboard
Problemi di scacchi 24,24 % Epoch evaluations
GDPval — compiti di professioni reali 21,1 % sforzo: high
ARC-AGI-2 15,98 %
APEX-Agents 15,2 %