Math · weight 8%数学 · 权重 8%
AIME 2025
⚠ saturation watchlist饱和观察名单 official site官网 ↗
What it tests: Problems from the 2025 American Invitational Mathematics Examination — olympiad-level math that requires multi-step derivation, not pattern matching.
考什么:2025 年美国数学邀请赛真题——奥赛级数学题,需要多步推导而不是套题型。
Why it counts: The default math headline number vendors quote — but the best reasoning models now approach 95-99%, so we pair it with FrontierMath for headroom.
为什么算数:厂商最爱引用的数学成绩——但顶级推理模型已接近 95-99% 天花板,所以我们搭配 FrontierMath 保持区分度。
| Maintainer维护方 | MAA(竞赛主办方),社区汇总 |
|---|---|
| License许可 | 题目版权 MAA,成绩公开引用 |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 85 |
◈
Standings实时排名
55 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 LunaOpenAI | 100 | 100 | — | 3rd-party第三方 | source ↗×5 |
| 2 | GPT-5.5OpenAI | 100 | 100 | — | 3rd-party第三方 | source ↗×5⚠±4.8 |
| 3 | Gemini 3.6 FlashGoogle | 100 | 100 | — | 3rd-party第三方 | source ↗×2⚠±6 |
| 4 | Kimi K2.7 CodeMoonshot AI | 100 | 100 | — | 3rd-party第三方 | source ↗ |
| 5 | LongCat 2.0Meituan | 100 | 100 | — | vendor-reported厂商自报 | source ↗×2 |
| 6 | Claude Fable 5Anthropic | 99.7 | 100 | — | 3rd-party第三方 | source ↗×3⚠±12.7 |
| 7 | GLM 5.2Z.ai | 98.6 | 99 | 2026-07-17 | 3rd-party第三方 | source ↗×6 |
| 8 | Claude Opus 4.8Anthropic | 98.3 | 98 | — | 3rd-party第三方 | source ↗×6 |
| 9 | Step 3.7 FlashStepFun | 97.3 | 97 | — | 3rd-party第三方 | source ↗ |
| 10 | GPT-5.6 SolOpenAI | 97 | 97 | — | 3rd-party第三方 | source ↗×7⚠±3 |
| 11 | Claude Opus 5Anthropic | 97 | 97 | — | 3rd-party第三方 | source ↗×3⚠±5.2 |
| 12 | GPT-5.6 TerraOpenAI | 97 | 97 | — | 3rd-party第三方 | source ↗ |
| 13 | DeepSeek V4 Pro 0423DeepSeek | 97⚡high | 97 | 2026-05 | 3rd-party第三方 | source ↗×5 |
| 14 | DeepSeek V4 Flash 0423DeepSeek | 97 | 97 | — | 3rd-party第三方 | source ↗×3⚠±27 |
| 15 | Gemini 3.5 FlashGoogle | 96.67 | 97 | — | 3rd-party第三方 | source ↗×3 |
| 16 | Kimi K3Moonshot AI | 96.2 | 96 | — | 3rd-party第三方 | source ↗×5 |
| 17 | Kimi K2 ThinkingMoonshot AI | 96.1⚡high | 96 | 2025-12 | 3rd-party第三方 | source ↗×6⚠±5.5 |
| 18 | DeepSeek V3.2DeepSeek | 96⚡high | 96 | — | 3rd-party第三方 | source ↗×4⚠±13.6 |
| 19 | GLM 5.1Z.ai | 95.3 | 95 | — | 3rd-party第三方 | source ↗×4 |
| 20 | gpt-oss-120bOpenAI | 93.4 | 93 | — | 3rd-party第三方 | source ↗×3 |
| 21 | Gemini 3.1 Pro PreviewGoogle | 93.3 | 93 | — | 3rd-party第三方 | source ↗×5⚠±8.8 |
| 22 | MiniMax M3MiniMax | 93.3 | 93 | — | 3rd-party第三方 | source ↗×4⚠±25 |
| 23 | DeepSeek V4 Flash 0731DeepSeek | 93.1⚡max | 93 | — | 3rd-party第三方 | source ↗×3 |
| 24 | Seed-2.0-LiteByteDance Seed | 93 | 93 | — | 3rd-party第三方 | source ↗×3 |
| 25 | Mistral Small 4Mistral AI | 93 | 93 | — | 3rd-party第三方 | source ↗×4 |
| 26 | Grok 4.5xAI | 91.7⚡high | 92 | — | 3rd-party第三方 | source ↗×3 |
| 27 | Grok 4.20xAI | 91.7 | 92 | — | 3rd-party第三方 | source ↗×3 |
| 28 | Mercury 2Inception | 91.1 | 91 | — | 3rd-party第三方 | source ↗×3 |
| 29 | Command ACohere | 90 | 90 | — | 3rd-party第三方 | source ↗ |
| 30 | Grok 4.3xAI | 89 | 89 | — | 3rd-party第三方 | source ↗×3⚠±11 |
| 31 | Seed-2.0-MiniByteDance Seed | 87 | 87 | — | 3rd-party第三方 | source ↗×2 |
| 32 | Mistral Medium 3.5Mistral AI | 86.3 | 86 | — | 3rd-party第三方 | source ↗×2⚠±46.3 |
| 33 | Qwen3.7 MaxQwen | 85.7 | 86 | — | 3rd-party第三方 | source ↗×5⚠±14.3 |
| 34 | Qwen3.7 PlusQwen | 85.7 | 86 | — | 3rd-party第三方 | source ↗×2⚠±18.4 |
| 35 | Mistral LargeMistral AI | 85 | 85 | — | 3rd-party第三方 | source ↗×3⚠±71 |
| 36 | Solar Pro 3Upstage | 84.3 | 84 | — | 3rd-party第三方 | source ↗ |
| 37 | Qwen3.8 Max (0902)Qwen | 81.5 | 82 | — | 3rd-party第三方 | source ↗×2 |
| 38 | MiniMax M2.7MiniMax | 78.3 | 78 | — | 3rd-party第三方 | source ↗×2 |
| 39 | ERNIE 4.5 VL 424B A47B Baidu | 78 | 78 | — | 3rd-party第三方 | source ↗×2⚠±36.7 |
| 40 | Hunyuan A13B InstructTencent | 76.8 | 77 | — | 3rd-party第三方 | source ↗×3 |
| 41 | KAT-Coder-Pro V2.5Kwaipilot | 72.5 | 73 | — | vendor-reported厂商自报 | source ↗ |
| 42 | Qwen3.7 FlashQwen | 67.3 | 67 | — | 3rd-party第三方 | source ↗ |
| 43 | Claude Sonnet 5Anthropic | 57.4 | 57 | — | 3rd-party第三方 | source ↗×3⚠±39.6 |
| 44 | Claude Haiku 4.5Anthropic | 39 | 39 | — | 3rd-party第三方 | source ↗×3⚠±61 |
| 45 | MiMo-V2.5-ProXiaomi | 37.3 | 37 | — | 3rd-party第三方 | source ↗×2⚠±57.5 |
| 46 | Gemini 3.5 Flash LiteGoogle | 36 | 36 | — | 3rd-party第三方 | source ↗×3⚠±60.67 |
| 47 | Muse Spark 1.1meta | 30 | 30 | — | vendor-reported厂商自报 | source ↗ |
| 48 | Gemini 3.1 Flash LiteGoogle | 30 | 30 | — | 3rd-party第三方 | source ↗×5⚠±58.3 |
| 49 | Sonar ProPerplexity | 29 | 29 | — | 3rd-party第三方 | source ↗×2⚠±48 |
| 50 | Llama 4 MaverickMeta | 20 | 20 | — | 3rd-party第三方 | source ↗ |
| 51 | Nova Premier 1.0Amazon | 17 | 17 | — | 3rd-party第三方 | source ↗×2 |
| 52 | Nova Pro 1.0Amazon | 7 | 7 | — | 3rd-party第三方 | source ↗ |
| 53 | Command R+ (08-2024)Cohere | 6.7 | 7 | — | 3rd-party第三方 | source ↗ |
| 54 | Phi 4Microsoft | 6.7 | 7 | — | 3rd-party第三方 | source ↗×3⚠±56.2 |
| 55 | Llama 4 ScoutMeta | 6.7 | 7 | — | 3rd-party第三方 | source ↗ |