Coding · weight 12%代码 · 权重 12%
SWE-bench Verified
What it tests: Real GitHub issues from popular Python repos. The model must produce a patch that makes failing tests pass. 'Verified' is the 500-issue human-validated subset.
考什么:来自热门 Python 仓库的真实 GitHub issue,模型要交出能让失败测试通过的补丁。Verified 是经过人工校验的 500 题子集。
Why it counts: The most-cited coding benchmark in 2026 launch posts — it measures whether a model can do actual software engineering, not just write snippets.
为什么算数:2026 年厂商发布会引用最多的代码 benchmark——考的是真刀真枪修 bug 的软件工程能力,不是写代码片段。头部已达 90%+,注意区分度在收窄。
| Maintainer维护方 | OpenAI + Princeton(原团队) |
|---|---|
| License许可 | MIT,需引用 |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 75 |
◈
Standings实时排名
40 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 SolOpenAI | 96.2⚡max | 100 | 2026-08 | 3rd-party第三方 | source ↗×8 |
| 2 | Claude Opus 5Anthropic | 96 | 100 | 2026-09-10 | official官方榜 | source ↗×10 |
| 3 | Claude Fable 5Anthropic | 95 | 99 | 2026-08 | 3rd-party第三方 | source ↗×5 |
| 4 | Kimi K3Moonshot AI | 93.4 | 97 | 2026-08 | 3rd-party第三方 | source ↗×7⚠±18.3 |
| 5 | GPT-5.6 LunaOpenAI | 93 | 97 | — | vendor-reported厂商自报 | source ↗ |
| 6 | Gemini 3.6 FlashGoogle | 90 | 94 | — | 3rd-party第三方 | source ↗×3⚠±31.3 |
| 7 | Claude Opus 4.8Anthropic | 88.6 | 92 | 2026-08 | 3rd-party第三方 | source ↗×6 |
| 8 | Qwen3.8 Max (0902)Qwen | 87.3 | 91 | — | 3rd-party第三方 | source ↗×2⚠±21.2 |
| 9 | GPT-5.5OpenAI | 87 | 90 | 2026-08 | 3rd-party第三方 | source ↗×7⚠±6.1 |
| 10 | Grok 4.5xAI | 86.6 | 90 | 2026-08 | 3rd-party第三方 | source ↗×7⚠±21.9 |
| 11 | Claude Sonnet 5Anthropic | 85.2 | 89 | 2026-08 | 3rd-party第三方 | source ↗×7⚠±12.5 |
| 12 | DeepSeek V4 Pro 0423DeepSeek | 80.6 | 84 | 2026-08 | 3rd-party第三方 | source ↗×9 |
| 13 | Gemini 3.1 Pro PreviewGoogle | 80.6 | 84 | 2026-08 | 3rd-party第三方 | source ↗×9⚠±3.3 |
| 14 | MiniMax M3MiniMax | 80.5 | 84 | 2026-06-01 | 3rd-party第三方 | source ↗×5 |
| 15 | Qwen3.7 MaxQwen | 80.4 | 84 | — | 3rd-party第三方 | source ↗×7 |
| 16 | Qwen3.7 FlashQwen | 80.4 | 84 | — | 3rd-party第三方 | source ↗ |
| 17 | Kimi K2.7 CodeMoonshot AI | 80.2 | 83 | 2026-08 | 3rd-party第三方 | source ↗×6 |
| 18 | DeepSeek V4 Flash 0731DeepSeek | 79 | 82 | — | 3rd-party第三方 | source ↗ |
| 19 | DeepSeek V4 Flash 0423DeepSeek | 79 | 82 | 2026-08 | 3rd-party第三方 | source ↗×6 |
| 20 | Gemini 3.5 FlashGoogle | 78 | 81 | — | 3rd-party第三方 | source ↗×6⚠±40.2 |
| 21 | MiniMax M2.7MiniMax | 78 | 81 | — | 3rd-party第三方 | source ↗×2 |
| 22 | Mistral Medium 3.5Mistral AI | 77.6 | 81 | 2026-08 | 3rd-party第三方 | source ↗×6 |
| 23 | Grok 4.20xAI | 76.7⚡high | 80 | 2026-04-11 | 3rd-party第三方 | source ↗×3 |
| 24 | Step 3.7 FlashStepFun | 76.3 | 79 | — | 3rd-party第三方 | source ↗×2 |
| 25 | Seed-2.0-LiteByteDance Seed | 73.5 | 76 | — | 3rd-party第三方 | source ↗×3 |
| 26 | Claude Haiku 4.5Anthropic | 73.3 | 76 | 2026-08 | 3rd-party第三方 | source ↗×5⚠±21.9 |
| 27 | DeepSeek V3.2DeepSeek | 73.1⚡high | 76 | 2026-08 | 3rd-party第三方 | source ↗×7 |
| 28 | Grok 4.3xAI | 71.4 | 74 | — | 3rd-party第三方 | source ↗×2 |
| 29 | Kimi K2 ThinkingMoonshot AI | 71.3⚡high | 74 | 2026-08 | 3rd-party第三方 | source ↗×4 |
| 30 | Nemotron 3 UltraNVIDIA | 70.7 | 73 | — | 3rd-party第三方 | source ↗×5 |
| 31 | Seed-2.0-MiniByteDance Seed | 67.9 | 71 | — | 3rd-party第三方 | source ↗×3 |
| 32 | GLM 5.2Z.ai | 62.1 | 65 | 2026-08 | 3rd-party第三方 | source ↗×8⚠±20.7 |
| 33 | gpt-oss-120bOpenAI | 60.7 | 63 | 2026-08 | 3rd-party第三方 | source ↗×5 |
| 34 | Mistral Small 4Mistral AI | 60.47 | 63 | 2026-03-01 | 3rd-party第三方 | source ↗ |
| 35 | GLM 5.1Z.ai | 58.4 | 61 | — | 3rd-party第三方 | source ↗ |
| 36 | Gemini 3.5 Flash LiteGoogle | 55.1 | 57 | — | 3rd-party第三方 | source ↗×2 |
| 37 | Mistral LargeMistral AI | 49.5 | 51 | 2026-08 | 3rd-party第三方 | source ↗×4 |
| 38 | Llama 4 MaverickMeta | 48.7 | 51 | — | 3rd-party第三方 | source ↗ |
| 39 | Nova Premier 1.0Amazon | 42.4 | 44 | 2025-04 | vendor-reported厂商自报 | source ↗ |
| 40 | Command ACohere | 26.8 | 28 | — | 3rd-party第三方 | source ↗×2 |