Knowledge · weight 15%知识 · 权重 15%
MMLU-Pro
⚠ saturation watchlist饱和观察名单 official site官网 ↗
What it tests: A harder re-build of the classic MMLU: 12K questions, 10 answer choices instead of 4, more reasoning-heavy, 14 domains. The original MMLU is saturated (>93%) and retired from our scoring.
考什么:经典 MMLU 的加难重制版:1.2 万题、10 个选项(原来 4 个)、更重推理、14 个学科。原版 MMLU 已饱和(>93%),我们不再计入评分。
Why it counts: Still the standard 'general knowledge' yardstick — but top models cluster within a few points, so we watch its saturation closely.
为什么算数:仍是'通用知识'的标准尺子,但头部模型分差已很小——我们已把它列入饱和观察名单,随时准备降权。
| Maintainer维护方 | TIGER-AI-Lab |
|---|---|
| License许可 | Apache 2.0,需署名 |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 85 |
◈
Standings实时排名
30 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | Grok 4.20xAI | 95 | 100 | — | vendor-reported厂商自报 | source ↗ |
| 2 | Claude Opus 5Anthropic | 91.59 | 96 | 2026-08 | 3rd-party第三方 | source ↗×3 |
| 3 | Claude Fable 5Anthropic | 91.5 | 96 | 2026-08-19 | 3rd-party第三方 | source ↗×2 |
| 4 | Gemini 3.1 Pro PreviewGoogle | 89.8 | 95 | 2026-08-14 | 3rd-party第三方 | source ↗×5 |
| 5 | Qwen3.7 MaxQwen | 89.6 | 94 | 2026-08 | 3rd-party第三方 | source ↗×3 |
| 6 | Grok 4.5xAI | 89.2 | 94 | — | 3rd-party第三方 | source ↗×2 |
| 7 | GPT-5.6 SolOpenAI | 89.1 | 94 | 2026-08 | 3rd-party第三方 | source ↗×2⚠±6.1 |
| 8 | GLM 5.2Z.ai | 88.9 | 94 | 2026-07 | 3rd-party第三方 | source ↗×2 |
| 9 | Qwen3.7 PlusQwen | 88.5 | 93 | 2026-08 | 3rd-party第三方 | source ↗×3 |
| 10 | Kimi K2 ThinkingMoonshot AI | 87.572⚡high | 92 | — | 3rd-party第三方 | source ↗×2 |
| 11 | Claude Sonnet 5Anthropic | 87.55 | 92 | — | 3rd-party第三方 | source ↗×3 |
| 12 | DeepSeek V4 Pro 0423DeepSeek | 87.5 | 92 | — | 3rd-party第三方 | source ↗×5 |
| 13 | GLM 5.1Z.ai | 87 | 92 | — | 3rd-party第三方 | source ↗×2⚠±5 |
| 14 | Nemotron 3 UltraNVIDIA | 86.8 | 91 | — | 3rd-party第三方 | source ↗×2 |
| 15 | DeepSeek V4 Flash 0423DeepSeek | 86.2 | 91 | 2026-08 | 3rd-party第三方 | source ↗×4 |
| 16 | GPT-5.5OpenAI | 86.1 | 91 | — | 3rd-party第三方 | source ↗ |
| 17 | DeepSeek V3.2DeepSeek | 85 | 89 | — | 3rd-party第三方 | source ↗×3 |
| 18 | MiniMax M2.7MiniMax | 82 | 86 | — | 3rd-party第三方 | source ↗ |
| 19 | Mistral Medium 3.5Mistral AI | 81.3 | 86 | — | 3rd-party第三方 | source ↗×2⚠±5.3 |
| 20 | Llama 4 MaverickMeta | 80.5 | 85 | — | 3rd-party第三方 | source ↗×4 |
| 21 | gpt-oss-120bOpenAI | 79 | 83 | — | 3rd-party第三方 | source ↗×3⚠±11 |
| 22 | MiniMax M3MiniMax | 78.1 | 82 | — | 3rd-party第三方 | source ↗ |
| 23 | Gemini 3.1 Flash LiteGoogle | 78 | 82 | — | 3rd-party第三方 | source ↗ |
| 24 | Command R+ (08-2024)Cohere | 75.7 | 80 | — | 3rd-party第三方 | source ↗ |
| 25 | Sonar ProPerplexity | 75.5 | 79 | — | 3rd-party第三方 | source ↗ |
| 26 | Mistral LargeMistral AI | 73.11 | 77 | — | 3rd-party第三方 | source ↗ |
| 27 | Phi 4Microsoft | 71.4 | 75 | — | 3rd-party第三方 | source ↗ |
| 28 | Command ACohere | 71.2 | 75 | — | 3rd-party第三方 | source ↗ |
| 29 | Claude Haiku 4.5Anthropic | 65 | 68 | — | 3rd-party第三方 | source ↗×2⚠±15 |
| 30 | Gemini 3.6 FlashGoogle | 55.35 | 58 | — | 3rd-party第三方 | source ↗ |