The AI tools index that doesn't waste your time.不浪费你时间的 AI 工具索引。
Reasoning · weight 15%推理 · 权重 15%

Humanity's Last Exam

official site官网

What it tests: 3,000 expert-written questions across 100+ disciplines, explicitly designed as the hardest closed-book exam for AI. Frontier models still score well below human experts.

考什么:3000 道由各领域专家撰写的闭卷考题,覆盖 100+ 学科,设计目标就是'AI 最难的一张卷子'。顶尖模型得分仍远低于人类专家。

Why it counts: Currently the single most-discriminating reasoning benchmark — top models score ~25-65%, leaving huge headroom to separate this year's flagships.

为什么算数:当前区分度最高的推理 benchmark——头部模型只有 25-65 分,天花板很高,最能拉开今年旗舰模型的差距。

Maintainer维护方Center for AI Safety + Scale AI
License许可公开数据集
Reference point (prior-gen SOTA)参考点(上一代 SOTA)30

Standings实时排名

55 models with sourced scores 个模型有溯源成绩
#Model模型Score成绩Index指数Dated日期Measured by测评方
1Claude Sonnet 5Anthropic57.41002026-083rd-party第三方source ↗×4⚠±14.2
2Qwen3.8 Max (0902)Qwen56.2982026-083rd-party第三方source ↗×3⚠±12.6
3GLM 5.2Z.ai54.7952026-08-12official官方榜source ↗×6⚠±14.6
4Claude Opus 5Anthropic54.4⚡max953rd-party第三方source ↗×4⚠±12.2
5Qwen3.7 MaxQwen53.5932026-083rd-party第三方source ↗×3⚠±12.1
6Claude Fable 5Anthropic53.393official官方榜source ↗×5
7Grok 4.20xAI50.7883rd-party第三方source ↗×2⚠±18.5
8Step 3.7 FlashStepFun49.5863rd-party第三方source ↗×2
9GPT-5.6 Sol ProOpenAI48.9853rd-party第三方source ↗
10DeepSeek V4 Pro 0423DeepSeek48.2⚡max842026-083rd-party第三方source ↗×5⚠±25.5
11MiMo-V2.5-ProXiaomi48843rd-party第三方source ↗×2⚠±12.3
12GPT-5.6 SolOpenAI47.2⚡high823rd-party第三方source ↗×4
13GPT-5.6 TerraOpenAI47.2822026-07-313rd-party第三方source ↗×4⚠±5.4
14Hy3Tencent47823rd-party第三方source ↗
15Gemini 3.1 Pro PreviewGoogle46.44⚡high81official官方榜source ↗×9⚠±5.94
16Claude Opus 4.8Anthropic46⚡max803rd-party第三方source ↗×6⚠±11.9
17DeepSeek V4 Flash 0731DeepSeek45.5⚡max793rd-party第三方source ↗×2⚠±5.2
18Muse Spark 1.1meta45⚡max783rd-party第三方source ↗×3⚠±17.1
19Kimi K3Moonshot AI44.377official官方榜source ↗×5⚠±11.7
20GPT-5.6 Luna ProOpenAI44.3773rd-party第三方source ↗
21GPT-5.6 Terra ProOpenAI41.8733rd-party第三方source ↗
22Gemini 3.6 FlashGoogle40.8712026-07-213rd-party第三方source ↗×3
23Muse Spark 1.2meta40.5671official官方榜source ↗×2⚠±3.44
24Grok 4.5xAI40.3703rd-party第三方source ↗×4
25Gemini 3.5 FlashGoogle40.2703rd-party第三方source ↗×3
26GPT-5.6 LunaOpenAI37.2653rd-party第三方source ↗×3
27MiniMax M3MiniMax37.1653rd-party第三方source ↗×4
28GPT-5.5OpenAI36.2463official官方榜source ↗×6⚠±15.96
29Grok 4.3xAI35613rd-party第三方source ↗×2
30Qwen3.7 PlusQwen34.7603rd-party第三方source ↗×2
31ERNIE 4.5 VL 424B A47B Baidu33.6593rd-party第三方source ↗
32Kimi K2.7 CodeMoonshot AI32.8573rd-party第三方source ↗×3⚠±12.6
33DeepSeek V4 Flash 0423DeepSeek32.1563rd-party第三方source ↗×2⚠±17.3
34MiniMax M2.7MiniMax29.6523rd-party第三方source ↗×4⚠±9.9
35Nemotron 3 UltraNVIDIA26.6463rd-party第三方source ↗×3
36Seed-2.0-LiteByteDance Seed25.745vendor-reported厂商自报source ↗
37Claude Haiku 4.5Anthropic25.244official官方榜source ↗×2⚠±21
38DeepSeek V3.2DeepSeek25.1443rd-party第三方source ↗×3
39Kimi K2 ThinkingMoonshot AI24.37⚡high42official官方榜source ↗×4⚠±20.53
40GLM 5.1Z.ai23.6841official官方榜source ↗×3⚠±6.42
41gpt-oss-120bOpenAI19.634official官方榜source ↗×3⚠±4.7
42Command R+ (08-2024)Cohere19.2333rd-party第三方source ↗
43Gemini 3.5 Flash LiteGoogle18.8332026-07-213rd-party第三方source ↗×3
44Gemini 3.1 Flash LiteGoogle17.2303rd-party第三方source ↗×2⚠±8.7
45Mercury 2Inception15.5273rd-party第三方source ↗
46Command ACohere11.4203rd-party第三方source ↗×2⚠±7.4
47Mistral Small 4Mistral AI9.5173rd-party第三方source ↗×2
48Sonar ProPerplexity7.3133rd-party第三方source ↗
49Llama 4 MaverickMeta5.6810official官方榜source ↗×3
50Nova Pro 1.0Amazon4.48official官方榜source ↗×2
51Mistral Medium 3.5Mistral AI4.37official官方榜source ↗×5⚠±8.5
52Llama 4 ScoutMeta4.37official官方榜source ↗×3
53Nova Premier 1.0Amazon4.273rd-party第三方source ↗
54Mistral LargeMistral AI4.173rd-party第三方source ↗
55Phi 4Microsoft3.973rd-party第三方source ↗

How scores become the Intelligence Score →成绩如何合成智能评分 →