AI model benchmarks
25 benchmarks across reasoning, maths, coding and agentic tasks. Each one ranks every model that carries a score and puts its API cost alongside, where it has one.
Benchmarks
25
leaderboards
Categories
5
reasoning · maths · coding · agents
Models ranked
453
on the widest board
Source
AA + HF
verified daily
Headline indices
3 benchmarksIntelligence IndexComposite
453 models ranked- 1
Claude Opus 563.1 - 2
Claude Fable 562.1 - 3
GPT-5.6 Sol60.9
Coding IndexComposite
184 models ranked- 1
GPT-5.6 Sol78.3 - 2
Claude Opus 578.0 - 3
Grok 4.676.8
Agentic IndexComposite
159 models ranked- 1
Claude Opus 559.2 - 2
GLM 5.359.1 - 3
Grok 4.658.7
Reasoning & knowledge
7 benchmarksGPQA Diamond
441 models ranked- 1
Grok 4.695% - 2
Gemini 3.7 Flash95% - 3
Gemini 3.1 Pro Preview94%
Humanity's Last Exam
430 models ranked- 1
Claude Fable 555% - 2
Claude Opus 555% - 3
GPT-5.6 Sol49%
CritPt
349 models ranked- 1
GPT-5.6 Sol32% - 2
GPT-5.5 Pro31% - 3
GPT-5.6 Terra30%
Omniscience
347 models ranked- 1
Claude Fable 543.3 - 2
Claude Opus 537.1 - 3
Gemini 3.1 Pro Preview31.9
MMLU-Pro
269 models ranked- 1
Gemini 3 Pro90% - 2
Claude Opus 4.589% - 3
Gemini 3 Flash89%
MMMU-Pro
151 models ranked- 1
Gemini 3.7 Flash85% - 2
Claude Opus 585% - 3
Gemini 3.5 Flash84%
ARC-AGI-2
61 models ranked- 1
GPT-5.6 Sol93% - 2
GPT-5.585% - 3
GPT-5.5 Pro85%
Math
1 benchmarksCoding & agents
12 benchmarksSciCode
428 models ranked- 1
Claude Fable 560% - 2
Gemini 3.1 Pro Preview59% - 3
Kimi K359%
τ²-bench
314 models ranked- 1
GLM 5.299% - 2JT-35B-Flash99%
- 3
GLM 4.7 Flash99%
TerminalBench Hard
308 models ranked- 1
GPT-5.6 Sol66% - 2
Claude Fable 563% - 3
GPT-5.6 Terra63%
LiveCodeBench
266 models ranked- 1
Gemini 3 Pro92% - 2
Gemini 3 Flash91% - 3
DeepSeek V3 2 Speciale90%
TerminalBench v2.1
165 models ranked- 1
GPT-5.6 Sol90% - 2
Claude Opus 589% - 3
Grok 4.688%
τ-bench Banking
165 models ranked- 1
Qwen3.8 Max51% - 2
Grok 4.651% - 3
GLM 5.350%
GDPval
162 models ranked- 1
Claude Opus 51844.7 - 2
Grok 4.61747.5 - 3
Claude Fable 51737.7
SWE-bench Verified
39 models ranked- 1Macaron V1 Venti86%
- 2
DeepSeek V4 Pro 042381% - 3
MiniMax M381%
IT-Bench SRE
35 models ranked- 1
GPT-5.6 Sol56% - 2
GPT-5.6 Terra51% - 3
Kimi K348%
SWE-bench Pro
33 models ranked- 1
Qwen3.8 2.4T A95B68% - 2Hy4 preview66%
- 3
Qwen3.8-Flash-Next63%
APEX Agents
31 models ranked- 1
Gemini 3.5 Flash47% - 2
Kimi K341% - 3
GPT-5.6 Terra39%
AA-Briefcase
24 models ranked- 1
Claude Fable 554% - 2
Claude Sonnet 545% - 3
Claude Opus 4.843%
Instruction & long-context
2 benchmarksBenchmark scores via ARC Prize, Artificial Analysis and Hugging Face leaderboards · pricing verified against LiteLLM + OpenRouter · refreshed daily
Every weekday
AI moves fast. Here's your debrief.
News, analysis, tools, and more.
For people who build with AI