Reasoning · weight 15%推理 · 权重 15%
Humanity's Last Exam
What it tests: 3,000 expert-written questions across 100+ disciplines, explicitly designed as the hardest closed-book exam for AI. Frontier models still score well below human experts.
考什么:3000 道由各领域专家撰写的闭卷考题,覆盖 100+ 学科,设计目标就是'AI 最难的一张卷子'。顶尖模型得分仍远低于人类专家。
Why it counts: Currently the single most-discriminating reasoning benchmark — top models score ~25-65%, leaving huge headroom to separate this year's flagships.
为什么算数:当前区分度最高的推理 benchmark——头部模型只有 25-65 分,天花板很高,最能拉开今年旗舰模型的差距。
| Maintainer维护方 | Center for AI Safety + Scale AI |
|---|---|
| License许可 | 公开数据集 |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 30 |
◈
Standings实时排名
55 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | Claude Sonnet 5Anthropic | 57.4 | 100 | 2026-08 | 3rd-party第三方 | source ↗×4⚠±14.2 |
| 2 | Qwen3.8 Max (0902)Qwen | 56.2 | 98 | 2026-08 | 3rd-party第三方 | source ↗×3⚠±12.6 |
| 3 | GLM 5.2Z.ai | 54.7 | 95 | 2026-08-12 | official官方榜 | source ↗×6⚠±14.6 |
| 4 | Claude Opus 5Anthropic | 54.4⚡max | 95 | — | 3rd-party第三方 | source ↗×4⚠±12.2 |
| 5 | Qwen3.7 MaxQwen | 53.5 | 93 | 2026-08 | 3rd-party第三方 | source ↗×3⚠±12.1 |
| 6 | Claude Fable 5Anthropic | 53.3 | 93 | — | official官方榜 | source ↗×5 |
| 7 | Grok 4.20xAI | 50.7 | 88 | — | 3rd-party第三方 | source ↗×2⚠±18.5 |
| 8 | Step 3.7 FlashStepFun | 49.5 | 86 | — | 3rd-party第三方 | source ↗×2 |
| 9 | GPT-5.6 Sol ProOpenAI | 48.9 | 85 | — | 3rd-party第三方 | source ↗ |
| 10 | DeepSeek V4 Pro 0423DeepSeek | 48.2⚡max | 84 | 2026-08 | 3rd-party第三方 | source ↗×5⚠±25.5 |
| 11 | MiMo-V2.5-ProXiaomi | 48 | 84 | — | 3rd-party第三方 | source ↗×2⚠±12.3 |
| 12 | GPT-5.6 SolOpenAI | 47.2⚡high | 82 | — | 3rd-party第三方 | source ↗×4 |
| 13 | GPT-5.6 TerraOpenAI | 47.2 | 82 | 2026-07-31 | 3rd-party第三方 | source ↗×4⚠±5.4 |
| 14 | Hy3Tencent | 47 | 82 | — | 3rd-party第三方 | source ↗ |
| 15 | Gemini 3.1 Pro PreviewGoogle | 46.44⚡high | 81 | — | official官方榜 | source ↗×9⚠±5.94 |
| 16 | Claude Opus 4.8Anthropic | 46⚡max | 80 | — | 3rd-party第三方 | source ↗×6⚠±11.9 |
| 17 | DeepSeek V4 Flash 0731DeepSeek | 45.5⚡max | 79 | — | 3rd-party第三方 | source ↗×2⚠±5.2 |
| 18 | Muse Spark 1.1meta | 45⚡max | 78 | — | 3rd-party第三方 | source ↗×3⚠±17.1 |
| 19 | Kimi K3Moonshot AI | 44.3 | 77 | — | official官方榜 | source ↗×5⚠±11.7 |
| 20 | GPT-5.6 Luna ProOpenAI | 44.3 | 77 | — | 3rd-party第三方 | source ↗ |
| 21 | GPT-5.6 Terra ProOpenAI | 41.8 | 73 | — | 3rd-party第三方 | source ↗ |
| 22 | Gemini 3.6 FlashGoogle | 40.8 | 71 | 2026-07-21 | 3rd-party第三方 | source ↗×3 |
| 23 | Muse Spark 1.2meta | 40.56 | 71 | — | official官方榜 | source ↗×2⚠±3.44 |
| 24 | Grok 4.5xAI | 40.3 | 70 | — | 3rd-party第三方 | source ↗×4 |
| 25 | Gemini 3.5 FlashGoogle | 40.2 | 70 | — | 3rd-party第三方 | source ↗×3 |
| 26 | GPT-5.6 LunaOpenAI | 37.2 | 65 | — | 3rd-party第三方 | source ↗×3 |
| 27 | MiniMax M3MiniMax | 37.1 | 65 | — | 3rd-party第三方 | source ↗×4 |
| 28 | GPT-5.5OpenAI | 36.24 | 63 | — | official官方榜 | source ↗×6⚠±15.96 |
| 29 | Grok 4.3xAI | 35 | 61 | — | 3rd-party第三方 | source ↗×2 |
| 30 | Qwen3.7 PlusQwen | 34.7 | 60 | — | 3rd-party第三方 | source ↗×2 |
| 31 | ERNIE 4.5 VL 424B A47B Baidu | 33.6 | 59 | — | 3rd-party第三方 | source ↗ |
| 32 | Kimi K2.7 CodeMoonshot AI | 32.8 | 57 | — | 3rd-party第三方 | source ↗×3⚠±12.6 |
| 33 | DeepSeek V4 Flash 0423DeepSeek | 32.1 | 56 | — | 3rd-party第三方 | source ↗×2⚠±17.3 |
| 34 | MiniMax M2.7MiniMax | 29.6 | 52 | — | 3rd-party第三方 | source ↗×4⚠±9.9 |
| 35 | Nemotron 3 UltraNVIDIA | 26.6 | 46 | — | 3rd-party第三方 | source ↗×3 |
| 36 | Seed-2.0-LiteByteDance Seed | 25.7 | 45 | — | vendor-reported厂商自报 | source ↗ |
| 37 | Claude Haiku 4.5Anthropic | 25.2 | 44 | — | official官方榜 | source ↗×2⚠±21 |
| 38 | DeepSeek V3.2DeepSeek | 25.1 | 44 | — | 3rd-party第三方 | source ↗×3 |
| 39 | Kimi K2 ThinkingMoonshot AI | 24.37⚡high | 42 | — | official官方榜 | source ↗×4⚠±20.53 |
| 40 | GLM 5.1Z.ai | 23.68 | 41 | — | official官方榜 | source ↗×3⚠±6.42 |
| 41 | gpt-oss-120bOpenAI | 19.6 | 34 | — | official官方榜 | source ↗×3⚠±4.7 |
| 42 | Command R+ (08-2024)Cohere | 19.2 | 33 | — | 3rd-party第三方 | source ↗ |
| 43 | Gemini 3.5 Flash LiteGoogle | 18.8 | 33 | 2026-07-21 | 3rd-party第三方 | source ↗×3 |
| 44 | Gemini 3.1 Flash LiteGoogle | 17.2 | 30 | — | 3rd-party第三方 | source ↗×2⚠±8.7 |
| 45 | Mercury 2Inception | 15.5 | 27 | — | 3rd-party第三方 | source ↗ |
| 46 | Command ACohere | 11.4 | 20 | — | 3rd-party第三方 | source ↗×2⚠±7.4 |
| 47 | Mistral Small 4Mistral AI | 9.5 | 17 | — | 3rd-party第三方 | source ↗×2 |
| 48 | Sonar ProPerplexity | 7.3 | 13 | — | 3rd-party第三方 | source ↗ |
| 49 | Llama 4 MaverickMeta | 5.68 | 10 | — | official官方榜 | source ↗×3 |
| 50 | Nova Pro 1.0Amazon | 4.4 | 8 | — | official官方榜 | source ↗×2 |
| 51 | Mistral Medium 3.5Mistral AI | 4.3 | 7 | — | official官方榜 | source ↗×5⚠±8.5 |
| 52 | Llama 4 ScoutMeta | 4.3 | 7 | — | official官方榜 | source ↗×3 |
| 53 | Nova Premier 1.0Amazon | 4.2 | 7 | — | 3rd-party第三方 | source ↗ |
| 54 | Mistral LargeMistral AI | 4.1 | 7 | — | 3rd-party第三方 | source ↗ |
| 55 | Phi 4Microsoft | 3.9 | 7 | — | 3rd-party第三方 | source ↗ |