0%

Glsrm Benchmarks · August 5, 2026

Independent vibe check of AI

Understand the AI landscape to choose the best model and provider for your use case — intelligence, speed, and cost, measured independently.

Frontier models

44

Labs tracked

18

Evals in the index

9

Snapshot

August 5, 2026

Highlights

Higher is better

Intelligence

Intelligence Index · best model per lab

  • 1Claude Opus 5 (max)61
  • 2GPT-5.6 Sol (max)59
  • 3Kimi K3 (max)57
  • 4Grok 4.5 (high)54
  • 5GLM-5.2 (max)51
  • 6Muse Spark 1.1 (xhigh)51
  • 7Gemini 3.5 Flash50
  • 8DeepSeek V4 Flash 0731 (max)50
  • 9Qwen3.7 Max46

Higher is better

Speed

Median output tokens per second · best per lab

  • 1Muse Spark 1.1 (xhigh)216
  • 2Command A+205
  • 3Qwen3.7 Max203
  • 4Gemini 3.5 Flash169
  • 5GLM-5.2 (max)150
  • 6Nemotron 3 Ultra145
  • 7Mistral Medium 3.5140
  • 8Solar Pro 3128
  • 9Nova 2.0 Pro Preview (medium)120

Lower is better

Price

USD per 1M tokens, 3:1 blended · cheapest per lab

  • 1DeepSeek V4 Flash 0731 (max)$0.18
  • 2Solar Pro 3$0.26
  • 3MiniMax-M3$0.53
  • 4MiMo-V2.5-Pro$0.54
  • 5Nemotron 3 Ultra$1.14
  • 6Inkling$1.76
  • 7Muse Spark 1.1 (xhigh)$2.00
  • 8GLM-5.2 (max)$2.09
  • 9Grok 4.5 (high)$3.00

Model comparison summary

Every model we track, ranked by Intelligence Index.

#ModelCreatorReleasedContextIntelligenceCodingAgenticSpeed (t/s)Blended $/1MLatency
1Claude Opus 5 (max)AnthropicJul 20261M61785555$10.0069s
2Claude Fable 5 (with fallback)AnthropicJun 20261M60775373$20.00141s
3GPT-5.6 Sol (max)OpenAIJul 20261M59775465$11.25138s
4Kimi K3 (max)OpenKimiJul 20261.0M57765037$6.0058s
5Claude Opus 4.8 (max)AnthropicMay 20261M56744758$10.0033s
6GPT-5.6 Terra (max)OpenAIJul 20261M557747127$4.50172s
7GPT-5.5 (xhigh)OpenAIApr 2026922k55754578$11.2572s
8Grok 4.5 (high)xAIJul 2026500k54724663$3.0012s
9Claude Opus 4.7 (max)AnthropicApr 20261M54744452$10.0023s
10Claude Sonnet 5 (max)AnthropicJun 20261M53724780$4.00198s
11GPT-5.6 Luna (max)OpenAIJul 20261M517146185$0.45136s
12GLM-5.2 (max)OpenZ AIJun 20261M516943150$2.0915s
13Muse Spark 1.1 (xhigh)MetaJul 20261.0M517138216$2.0012s
14Gemini 3.5 FlashGoogleMay 20261M507037169$3.3825s
15Gemini 3.6 FlashGoogleJul 20261M506939201$3.0016s
16DeepSeek V4 Flash 0731 (max)OpenDeepSeekJul 20261M506946104$0.1821s
17Claude Sonnet 4.6 (max)AnthropicFeb 20261M47634158$6.00100s
18Gemini 3.1 Pro PreviewGoogleFeb 20261M476921126$4.5032s
19Qwen3.7 MaxAlibabaMay 20261M466631203$3.7514s
20MiniMax-M3OpenMiniMaxJun 20261M44593573$0.5329s
21GPT-5.3 Codex (xhigh)OpenAIFeb 2026400k44124$4.8190s
22DeepSeek V4 Pro (max)OpenDeepSeekApr 20261M44593665$0.5470s
23Kimi K2.6OpenKimiApr 2026256k44623039$1.71118s
24Muse SparkMetaApr 2026262k435929
25MiMo-V2.5-ProOpenXiaomiApr 20261M42602968$0.5432s
26InklingOpenThinking MachinesJul 20261M41523280$1.7627s
27DeepSeek V4 Flash (max)OpenDeepSeekApr 20261M405631$0.17
28GLM-5.1OpenZ AIApr 2026200k40563074$2.1353s
29GPT-5.4 mini (xhigh)OpenAIMar 2026400k405630180$1.699.2s
30Qwen3.7 PlusAlibabaJun 20261M39562155$0.7039s
31MiniMax-M2.7OpenMiniMaxMar 2026205k38532680$0.5333s
32Nemotron 3 UltraOpenNVIDIAJun 2026262k384927145$1.1418s
33Grok 4.3 (high)xAIApr 20261M384224126$1.5621s
34Gemini 3.5 Flash-LiteGoogleJul 20261M374927344$0.8510s
35Qwen3.5 397B A17BOpenAlibabaFeb 2026262k34482071$1.3547s
36Mistral Medium 3.5OpenMistralApr 2026256k304719140$3.0016s
37Claude 4.5 HaikuAnthropicOct 2025200k304416113$2.0019s
38Gemma 4 31BOpenGoogleApr 2026256k2943143551s
39gpt-oss-120b (high)OpenOpenAIAug 2025131k243013185$0.2612s
40Command A+OpenCohereMay 2026192k2328920510s
41Nova 2.0 Pro Preview (medium)AmazonNov 2025256k22347120$3.4431s
42K2 Think V2OpenMBZUAI IFMDec 2025262k17212
43Solar Pro 3UpstageApr 2026128k14163128$0.2618s
GPT-5.5 Pro (xhigh)OpenAIApr 2026922k

Intelligence Index

Composite of 10 evaluations spanning reasoning, knowledge, math, coding, and agentic tool use. Higher is better.

010203040506061Claude Opus 5 (max)60Claude Fable 5 (with fall…59GPT-5.6 Sol (max)57Kimi K3 (max)56Claude Opus 4.8 (max)55GPT-5.6 Terra (max)55GPT-5.5 (xhigh)54Grok 4.5 (high)54Claude Opus 4.7 (max)53Claude Sonnet 5 (max)51GPT-5.6 Luna (max)51GLM-5.2 (max)51Muse Spark 1.1 (xhigh)50Gemini 3.5 Flash50Gemini 3.6 Flash50DeepSeek V4 Flash 0731 (m…47Claude Sonnet 4.6 (max)47Gemini 3.1 Pro Preview46Qwen3.7 Max44MiniMax-M344GPT-5.3 Codex (xhigh)44DeepSeek V4 Pro (max)44Kimi K2.643Muse Spark42MiMo-V2.5-Pro41Inkling40DeepSeek V4 Flash (max)40GLM-5.140GPT-5.4 mini (xhigh)39Qwen3.7 Plus38MiniMax-M2.738Nemotron 3 Ultra38Grok 4.3 (high)37Gemini 3.5 Flash-Lite34Qwen3.5 397B A17B30Mistral Medium 3.530Claude 4.5 Haiku29Gemma 4 31B24gpt-oss-120b (high)23Command A+22Nova 2.0 Pro Preview (med…17K2 Think V214Solar Pro 3

Incorporates GPQA Diamond, Humanity's Last Exam, AIME 2025, LiveCodeBench, SciCode, IFBench, Terminal-Bench Hard, τ²-Bench, and more.

Intelligence vs. Price

Intelligence Index against blended USD per 1M tokens (3:1 input:output, log scale).

0102030405060$0.2$0.5$1$2$5$10$20MedianPrice (USD per 1M tokens, blended 3:1, log scale)Intelligence Index↖ Most attractive quadrantGPT-5.6 Sol (max)Kimi K3 (max)GPT-5.5 (xhigh)Claude Opus 5 (max)Claude Fable 5 (wit…

Up and to the left wins: more intelligence per dollar. Models without public API pricing are excluded.

Intelligence vs. Output Speed

Each dot is a model. Higher = smarter · farther right = faster. Purple guides mark market medians; named labels highlight the efficiency frontier.

01020304050600100200300MedianOutput speed (tokens per second)Intelligence IndexMost attractive quadrant ↗GPT-5.6 Sol (max)Kimi K3 (max)Command A+Claude Opus 5 (max)Claude Fable 5 (wit…GPT-5.6 Terra (max)GPT-5.6 Luna (max)Muse Spark 1.1 (xhi…Gemini 3.5 Flash-Li…

Hover any dot for exact scores. The shaded corner is the sweet spot: above-median intelligence and above-median speed. Speed is the median tokens/s across providers serving each model.

Frontier Intelligence Over Time

Intelligence Index by release date. The dashed line tracks the running frontier.

2030405060Aug 25Oct 25Dec 25Feb 26Apr 26Jun 26Aug 26gpt-oss-120b (high)Claude 4.5 HaikuGPT-5.3 Codex (xhigh)Claude Sonnet 4.6 (max)Claude Opus 4.7 (max)GPT-5.5 (xhigh)Claude Opus 4.8 (max)Claude Fable 5 (with fa…Claude Opus 5 (max)Frontier

Claude Opus 5 set the current frontier on July 24, 2026 — 12 days before this snapshot.

Coding Index

Composite of coding evaluations (LiveCodeBench, SciCode, Terminal-Bench Hard). Higher is better.

02040608078Claude Opus 5 (max)77GPT-5.6 Sol (max)77GPT-5.6 Terra (max)77Claude Fable 5 (with fall…76Kimi K3 (max)75GPT-5.5 (xhigh)74Claude Opus 4.8 (max)74Claude Opus 4.7 (max)72Grok 4.5 (high)72Claude Sonnet 5 (max)71GPT-5.6 Luna (max)71Muse Spark 1.1 (xhigh)70Gemini 3.5 Flash69Gemini 3.6 Flash69DeepSeek V4 Flash 0731 (m…69GLM-5.2 (max)69Gemini 3.1 Pro Preview66Qwen3.7 Max63Claude Sonnet 4.6 (max)62Kimi K2.660MiMo-V2.5-Pro59DeepSeek V4 Pro (max)59MiniMax-M359Muse Spark56DeepSeek V4 Flash (max)56GPT-5.4 mini (xhigh)56Qwen3.7 Plus56GLM-5.153MiniMax-M2.752Inkling49Nemotron 3 Ultra49Gemini 3.5 Flash-Lite48Qwen3.5 397B A17B47Mistral Medium 3.544Claude 4.5 Haiku43Gemma 4 31B42Grok 4.3 (high)34Nova 2.0 Pro Preview (med…30gpt-oss-120b (high)28Command A+21K2 Think V216Solar Pro 3

Agentic Index

Tool calling and long-horizon agent tasks (τ²-Bench, Terminal-Bench). Higher is better.

0102030405055Claude Opus 5 (max)54GPT-5.6 Sol (max)53Claude Fable 5 (with fall…50Kimi K3 (max)47GPT-5.6 Terra (max)47Claude Opus 4.8 (max)47Claude Sonnet 5 (max)46Grok 4.5 (high)46DeepSeek V4 Flash 0731 (m…46GPT-5.6 Luna (max)45GPT-5.5 (xhigh)44Claude Opus 4.7 (max)43GLM-5.2 (max)41Claude Sonnet 4.6 (max)39Gemini 3.6 Flash38Muse Spark 1.1 (xhigh)37Gemini 3.5 Flash36DeepSeek V4 Pro (max)35MiniMax-M332Inkling31DeepSeek V4 Flash (max)31Qwen3.7 Max30Kimi K2.630GPT-5.4 mini (xhigh)30GLM-5.129MiMo-V2.5-Pro29Muse Spark27Nemotron 3 Ultra27Gemini 3.5 Flash-Lite26MiniMax-M2.724Grok 4.3 (high)21Gemini 3.1 Pro Preview21Qwen3.7 Plus20Qwen3.5 397B A17B19Mistral Medium 3.516Claude 4.5 Haiku14Gemma 4 31B13gpt-oss-120b (high)9Command A+7Nova 2.0 Pro Preview (med…3Solar Pro 32K2 Think V2

Intelligence Breakdown

Individual evaluation scores (0–100) behind the Intelligence Index. Darker is better, normalized per column.

ModelGPQA DiamondHumanity's Last ExamSciCodeIFBenchTerminal-Bench Hardτ²-Bench TelecomAA-LCR (Long Context)CritPtMMMU-Pro
Claude Opus 5 (max)93.252.655.770.029.184.7
Claude Fable 5 (with fallback)92.653.360.263.562.998.570.028.6
GPT-5.6 Sol (max)94.147.256.172.765.985.173.732.383.4
Kimi K3 (max)93.544.358.774.723.480.5
Claude Opus 4.8 (max)92.045.753.562.258.394.467.720.9
GPT-5.6 Terra (max)92.541.853.971.257.686.374.030.080.7
GPT-5.5 (xhigh)93.544.356.175.960.693.974.327.179.9
Grok 4.5 (high)93.140.354.167.715.480.4
Claude Opus 4.7 (max)91.439.654.558.651.588.670.312.078.8
Claude Sonnet 5 (max)91.139.653.670.716.977.3
GPT-5.6 Luna (max)91.137.252.574.020.678.6
GLM-5.2 (max)89.540.150.573.350.899.171.320.9
Muse Spark 1.1 (xhigh)89.845.158.263.315.1
Gemini 3.5 Flash92.241.053.176.340.995.369.313.184.3
Gemini 3.6 Flash92.838.352.769.710.683.2
DeepSeek V4 Flash 0731 (max)90.836.849.965.716.6
Claude Sonnet 4.6 (max)87.530.046.856.653.075.770.73.173.3
Gemini 3.1 Pro Preview94.144.758.977.153.895.672.717.782.4
Qwen3.7 Max92.338.148.880.550.894.769.013.4
MiniMax-M392.937.145.482.942.488.974.03.778.6
GPT-5.3 Codex (xhigh)91.539.953.275.453.086.074.016.978.5
DeepSeek V4 Pro (max)88.835.950.076.546.296.266.312.9
Kimi K2.691.135.953.576.043.995.969.78.079.4
Muse Spark88.439.951.575.945.591.569.711.380.5
MiMo-V2.5-Pro86.633.850.279.943.294.273.34.0
Inkling87.229.746.163.35.473.5
DeepSeek V4 Flash (max)89.432.144.979.235.695.063.07.1
GLM-5.186.828.043.876.343.297.762.34.6
GPT-5.4 mini (xhigh)87.526.649.973.352.383.369.310.073.3
Qwen3.7 Plus90.033.445.578.047.093.065.09.180.5
MiniMax-M2.787.428.147.075.739.484.868.70.6
Nemotron 3 Ultra86.726.639.981.436.483.367.03.1
Grok 4.3 (high)90.135.047.381.337.997.764.38.078.1
Gemini 3.5 Flash-Lite83.817.540.962.00.079.0
Qwen3.5 397B A17B89.327.342.078.840.995.665.71.777.3
Mistral Medium 3.574.812.839.668.833.394.261.00.064.9
Claude 4.5 Haiku67.29.743.354.327.354.770.30.058.6
Gemma 4 31B85.722.743.475.636.459.962.01.473.4
gpt-oss-120b (high)78.218.538.969.023.565.850.71.1
Command A+76.111.437.873.925.080.746.00.363.2
Nova 2.0 Pro Preview (medium)78.58.942.779.024.292.754.30.064.5
K2 Think V271.39.533.062.86.825.452.70.0
Solar Pro 372.410.124.771.27.686.327.00.0
GPT-5.5 Pro (xhigh)30.6

AIME 2025 and LiveCodeBench are retired for newer models and excluded here; MMMU-Pro applies to multimodal-evaluated models only.

Omniscience Index

Knowledge reliability from -100 to 100: correct answers score positive, hallucinated ones negative.

-40-200204040Claude Fable 5 (with fall…33Gemini 3.1 Pro Preview31Claude Opus 5 (max)27Claude Opus 4.8 (max)26Grok 4.5 (high)26Claude Opus 4.7 (max)24Gemini 3.6 Flash23Gemini 3.5 Flash22GPT-5.6 Sol (max)20GPT-5.5 (xhigh)18Kimi K3 (max)18Grok 4.3 (high)18Muse Spark 1.1 (xhigh)15Claude Sonnet 5 (max)14Qwen3.7 Max12Claude Sonnet 4.6 (max)10GPT-5.3 Codex (xhigh)7Gemini 3.5 Flash-Lite6Kimi K2.64Muse Spark4GLM-5.2 (max)4MiMo-V2.5-Pro2Qwen3.7 Plus2Inkling2GLM-5.11MiniMax-M31MiniMax-M2.70GPT-5.6 Terra (max)-1Nemotron 3 Ultra-4Command A+-4Claude 4.5 Haiku-10DeepSeek V4 Pro (max)-11GPT-5.6 Luna (max)-16DeepSeek V4 Flash 0731 (m…-19GPT-5.4 mini (xhigh)-23DeepSeek V4 Flash (max)-30Qwen3.5 397B A17B-34K2 Think V2-36Mistral Medium 3.5-45Gemma 4 31B-48Nova 2.0 Pro Preview (med…-50gpt-oss-120b (high)-54Solar Pro 3

A negative score means the model hallucinates more than it knows. Declining to answer scores zero — most models would rather guess.

GDPval Elo — Real-World Work

Elo from blind pairwise comparisons on real economically valuable work tasks, with web and shell access.

0500100015001852Claude Opus 5 (max)1743Claude Fable 5 (with fall…1730GPT-5.6 Sol (max)1685Kimi K3 (max)1600Claude Sonnet 5 (max)1588Claude Opus 4.8 (max)1578GPT-5.6 Luna (max)1577GPT-5.6 Terra (max)1558DeepSeek V4 Flash 0731 (m…1526Grok 4.5 (high)1508GLM-5.2 (max)1490GPT-5.5 (xhigh)1490Claude Opus 4.7 (max)1423Gemini 3.6 Flash1389MiniMax-M31375Claude Sonnet 4.6 (max)1371Muse Spark 1.1 (xhigh)1343Gemini 3.5 Flash1304DeepSeek V4 Pro (max)1271Qwen3.7 Max1264MiMo-V2.5-Pro1257GLM-5.11237Inkling1190DeepSeek V4 Flash (max)1189Kimi K2.61169GPT-5.4 mini (xhigh)1161Nemotron 3 Ultra1158MiniMax-M2.71144Muse Spark1137Gemini 3.5 Flash-Lite1085Grok 4.3 (high)963Gemini 3.1 Pro Preview961Qwen3.5 397B A17B943Qwen3.7 Plus931Mistral Medium 3.5911Claude 4.5 Haiku807Gemma 4 31B799gpt-oss-120b (high)713Command A+677Nova 2.0 Pro Preview (med…496Solar Pro 3377K2 Think V2

Higher is better. Judged across occupations from software engineering to financial analysis.

ITBench — SRE Incident Analysis

Average precision at full recall diagnosing live Kubernetes incidents. Higher is better.

0.000.100.200.300.400.500.56GPT-5.6 Sol (max)0.51GPT-5.6 Terra (max)0.48Kimi K3 (max)0.47Claude Opus 4.7 (max)0.46GPT-5.5 (xhigh)0.43GLM-5.2 (max)0.42Qwen3.7 Max0.40GPT-5.6 Luna (max)0.40Gemini 3.5 Flash0.40GLM-5.10.40Claude Sonnet 4.6 (max)0.38DeepSeek V4 Pro (max)0.38MiMo-V2.5-Pro0.37Gemma 4 31B0.35GPT-5.4 mini (xhigh)0.34Qwen3.5 397B A17B0.33Grok 4.3 (high)0.32DeepSeek V4 Flash (max)0.31Kimi K2.60.30Gemini 3.1 Pro Preview0.27Claude 4.5 Haiku0.27MiniMax-M2.70.06gpt-oss-120b (high)

Models investigate real cluster telemetry to find root causes. Even the frontier tops out below 0.5 — ops work is far from solved.

Output Tokens Used to Run the Intelligence Suite

Total tokens generated answering the full evaluation suite, split into answer and reasoning tokens.

Answer tokensReasoning tokens0M50M100M150M200M250M300M304MClaude Sonnet 5 (max)234MDeepSeek V4 Flash (max)216MGPT-5.4 mini (xhigh)206MDeepSeek V4 Flash 0731 (m…197MClaude Sonnet 4.6 (max)185MDeepSeek V4 Pro (max)165MKimi K2.6141MGLM-5.2 (max)133MKimi K3 (max)128MInkling125MGPT-5.6 Luna (max)122MGLM-5.1122MSolar Pro 3117MClaude Opus 4.8 (max)114MQwen3.7 Plus108MNemotron 3 Ultra106MK2 Think V2103MQwen3.7 Max101MClaude Opus 5 (max)100MClaude Opus 4.7 (max)96MMiMo-V2.5-Pro96MGPT-5.6 Terra (max)94MMuse Spark 1.1 (xhigh)91MMistral Medium 3.589MMiniMax-M388MClaude 4.5 Haiku88MQwen3.5 397B A17B87Mgpt-oss-120b (high)87MClaude Fable 5 (with fall…85MMiniMax-M2.783MGrok 4.3 (high)75MGemini 3.5 Flash72MGPT-5.5 (xhigh)70MGPT-5.6 Sol (max)63MCommand A+60MGrok 4.5 (high)59MGemini 3.6 Flash57MMuse Spark56MGemini 3.1 Pro Preview43MGemini 3.5 Flash-Lite38MGemma 4 31B35MNova 2.0 Pro Preview (med…

Reasoning-heavy models can burn 20–40× more tokens thinking than answering — which is exactly why blended price alone undersells true cost.

Cost to Run the Intelligence Suite

USD to complete every evaluation in the Intelligence Index, including reasoning tokens. Lower is better.

$0$1,000$2,000$3,000$4,000$5,000$5,631Claude Fable 5 (with fall…$4,010Claude Sonnet 5 (max)$3,836Claude Opus 5 (max)$3,753Claude Opus 4.8 (max)$3,738Claude Opus 4.7 (max)$3,356Claude Sonnet 4.6 (max)$2,824GPT-5.6 Sol (max)$2,778GPT-5.5 (xhigh)$2,437Kimi K3 (max)$1,454Qwen3.7 Max$1,403GPT-5.6 Terra (max)$1,095GPT-5.4 mini (xhigh)$1,041Gemini 3.5 Flash$939GLM-5.2 (max)$882Mistral Medium 3.5$841Kimi K2.6$815Gemini 3.1 Pro Preview$727Gemini 3.6 Flash$675GLM-5.1$583Grok 4.5 (high)$548Muse Spark 1.1 (xhigh)$530Nemotron 3 Ultra$528Qwen3.5 397B A17B$517Claude 4.5 Haiku$407Nova 2.0 Pro Preview (med…$311Qwen3.7 Plus$288Grok 4.3 (high)$204MiniMax-M3$176DeepSeek V4 Pro (max)$174GPT-5.6 Luna (max)$156Solar Pro 3$153Gemini 3.5 Flash-Lite$106DeepSeek V4 Flash (max)$99MiMo-V2.5-Pro$96gpt-oss-120b (high)$72DeepSeek V4 Flash 0731 (m…$0Gemma 4 31B$0Command A+

The spread is real: the same suite costs $19 on gpt-oss-20B and over $4,600 on the priciest frontier models.

Output Speed

Median output tokens per second across providers serving each model. Higher is better.

0100200300344Gemini 3.5 Flash-Lite216Muse Spark 1.1 (xhigh)205Command A+203Qwen3.7 Max201Gemini 3.6 Flash185gpt-oss-120b (high)185GPT-5.6 Luna (max)180GPT-5.4 mini (xhigh)169Gemini 3.5 Flash150GLM-5.2 (max)145Nemotron 3 Ultra140Mistral Medium 3.5128Solar Pro 3127GPT-5.6 Terra (max)126Gemini 3.1 Pro Preview126Grok 4.3 (high)124GPT-5.3 Codex (xhigh)120Nova 2.0 Pro Preview (med…113Claude 4.5 Haiku104DeepSeek V4 Flash 0731 (m…80Inkling80Claude Sonnet 5 (max)80MiniMax-M2.778GPT-5.5 (xhigh)74GLM-5.173MiniMax-M373Claude Fable 5 (with fall…71Qwen3.5 397B A17B68MiMo-V2.5-Pro65GPT-5.6 Sol (max)65DeepSeek V4 Pro (max)63Grok 4.5 (high)58Claude Sonnet 4.6 (max)58Claude Opus 4.8 (max)55Qwen3.7 Plus55Claude Opus 5 (max)52Claude Opus 4.7 (max)39Kimi K2.637Kimi K3 (max)35Gemma 4 31B

Latency — Time to First Answer Token

Seconds from request to first answer token, including reasoning time. Lower is better.

0.0s50s100s150s200s9.2sGPT-5.4 mini (xhigh)10sGemini 3.5 Flash-Lite10sCommand A+12sMuse Spark 1.1 (xhigh)12sgpt-oss-120b (high)12sGrok 4.5 (high)14sQwen3.7 Max15sGLM-5.2 (max)16sGemini 3.6 Flash16sMistral Medium 3.518sNemotron 3 Ultra18sSolar Pro 319sClaude 4.5 Haiku21sDeepSeek V4 Flash 0731 (m…21sGrok 4.3 (high)23sClaude Opus 4.7 (max)25sGemini 3.5 Flash27sInkling29sMiniMax-M331sNova 2.0 Pro Preview (med…32sMiMo-V2.5-Pro32sGemini 3.1 Pro Preview33sMiniMax-M2.733sClaude Opus 4.8 (max)39sQwen3.7 Plus47sQwen3.5 397B A17B51sGemma 4 31B53sGLM-5.158sKimi K3 (max)69sClaude Opus 5 (max)70sDeepSeek V4 Pro (max)72sGPT-5.5 (xhigh)90sGPT-5.3 Codex (xhigh)100sClaude Sonnet 4.6 (max)118sKimi K2.6136sGPT-5.6 Luna (max)138sGPT-5.6 Sol (max)141sClaude Fable 5 (with fall…172sGPT-5.6 Terra (max)198sClaude Sonnet 5 (max)

Max-effort reasoning modes pay for their scores in wait time: the smartest configurations routinely think for one to two minutes.

Pricing — Input and Output

USD per 1M tokens by direction. Lower is better.

Input priceOutput price$0.0$10$20$30$40$50$50Claude Fable 5 (with fall…$30GPT-5.6 Sol (max)$30GPT-5.5 (xhigh)$25Claude Opus 5 (max)$25Claude Opus 4.8 (max)$25Claude Opus 4.7 (max)$15Kimi K3 (max)$15Claude Sonnet 4.6 (max)$14GPT-5.3 Codex (xhigh)$12GPT-5.6 Terra (max)$12Gemini 3.1 Pro Preview$10Claude Sonnet 5 (max)$7.5Qwen3.7 Max$10Nova 2.0 Pro Preview (med…$9Gemini 3.5 Flash$6Grok 4.5 (high)$7.5Gemini 3.6 Flash$7.5Mistral Medium 3.5$4.4GLM-5.1$4.29GLM-5.2 (max)$4.25Muse Spark 1.1 (xhigh)$5Claude 4.5 Haiku$4.05Inkling$4Kimi K2.6$4.5GPT-5.4 mini (xhigh)$2.5Grok 4.3 (high)$3.6Qwen3.5 397B A17B$2.75Nemotron 3 Ultra$2.5Gemini 3.5 Flash-Lite$1.6Qwen3.7 Plus$0.87DeepSeek V4 Pro (max)$0.87MiMo-V2.5-Pro$1.2MiniMax-M3$1.2MiniMax-M2.7$1.2GPT-5.6 Luna (max)$0.6gpt-oss-120b (high)$0.6Solar Pro 3$0.28DeepSeek V4 Flash 0731 (m…$0.28DeepSeek V4 Flash (max)

Output tokens typically cost 2–4× input. Reasoning tokens bill as output, so thinking models multiply effective price.

Context Window

Maximum input tokens per request.

0k200k400k600k800k1M1.0MKimi K3 (max)1.0MMuse Spark 1.1 (xhigh)1MClaude Opus 5 (max)1MClaude Fable 5 (with fall…1MGPT-5.6 Sol (max)1MClaude Opus 4.8 (max)1MGPT-5.6 Terra (max)1MClaude Opus 4.7 (max)1MClaude Sonnet 5 (max)1MGPT-5.6 Luna (max)1MGLM-5.2 (max)1MGemini 3.5 Flash1MGemini 3.6 Flash1MDeepSeek V4 Flash 0731 (m…1MClaude Sonnet 4.6 (max)1MGemini 3.1 Pro Preview1MQwen3.7 Max1MMiniMax-M31MDeepSeek V4 Pro (max)1MMiMo-V2.5-Pro1MInkling1MDeepSeek V4 Flash (max)1MQwen3.7 Plus1MGrok 4.3 (high)1MGemini 3.5 Flash-Lite922kGPT-5.5 (xhigh)922kGPT-5.5 Pro (xhigh)500kGrok 4.5 (high)400kGPT-5.3 Codex (xhigh)400kGPT-5.4 mini (xhigh)262kMuse Spark262kNemotron 3 Ultra262kQwen3.5 397B A17B262kK2 Think V2256kKimi K2.6256kMistral Medium 3.5256kGemma 4 31B256kNova 2.0 Pro Preview (med…205kMiniMax-M2.7200kGLM-5.1200kClaude 4.5 Haiku192kCommand A+131kgpt-oss-120b (high)128kSolar Pro 3

Openness Index

Weights availability plus transparency of methodology and training data, 0–100.

02040608089K2 Think V283Nemotron 3 Ultra50DeepSeek V4 Pro (max)50DeepSeek V4 Flash (max)44GLM-5.2 (max)44DeepSeek V4 Flash 0731 (m…44GLM-5.139Kimi K3 (max)39MiMo-V2.5-Pro39Inkling39Qwen3.5 397B A17B39Gemma 4 31B39gpt-oss-120b (high)39Command A+33MiniMax-M333Kimi K2.633Mistral Medium 3.522MiniMax-M2.711Claude 4.5 Haiku

Only models with published openness scores shown. K2 Think V2 and Nemotron 3 Ultra lead; most frontier labs publish nothing.

Latest Insights

Reporting from the eval desk

Methodology: indices are composites of public evaluations run independently with standardized prompts; speed and latency are medians measured across API providers over the trailing 72 hours. Benchmark data: public model-evaluation snapshot, August 5, 2026. Prices are list API prices and change frequently. Company logos identify the respective model creators.