Coding · weight 6%代码 · 权重 6%
Terminal-Bench
What it tests: Real command-line tasks inside Docker containers: compiling, debugging, configuring systems. The model acts as an agent in an actual terminal.
考什么:在真实 Docker 容器里完成命令行任务:编译、调试、配环境。模型以 agent 身份在真终端里操作。
Why it counts: The fastest-rising agentic-coding benchmark of 2026 — closest proxy for 'can this model drive my dev environment'.
为什么算数:2026 年上升最快的代码 benchmark——最接近'这个模型能不能直接开动我的开发环境'的真实体验。
| Maintainer维护方 | Harbor Framework 团队 |
|---|---|
| License许可 | MIT |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 60 |
◈
Standings实时排名
40 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 SolOpenAI | 91.9 | 100 | — | official官方榜 | source ↗×9⚠±57.3 |
| 2 | Kimi K3Moonshot AI | 88.3 | 96 | — | official官方榜 | source ↗×6 |
| 3 | Qwen3.8 Max (0902)Qwen | 86.6 | 94 | — | 3rd-party第三方 | source ↗×3 |
| 4 | Claude Fable 5Anthropic | 83.8 | 91 | — | official官方榜 | source ↗×6⚠±53.9 |
| 5 | Grok 4.5xAI | 83.3 | 91 | — | official官方榜 | source ↗×3 |
| 6 | Muse Spark 1.2meta | 82.9 | 90 | — | vendor-reported厂商自报 | source ↗ |
| 7 | DeepSeek V4 Flash 0731DeepSeek | 82.7 | 90 | — | 3rd-party第三方 | source ↗×3 |
| 8 | GPT-5.5OpenAI | 82.7 | 90 | — | official官方榜 | source ↗×4 |
| 9 | DeepSeek V4 Flash 0423DeepSeek | 82.7 | 90 | 2026-07-31 | 3rd-party第三方 | source ↗×3⚠±25.8 |
| 10 | GLM 5.2Z.ai | 81 | 88 | — | 3rd-party第三方 | source ↗×5 |
| 11 | Claude Sonnet 5Anthropic | 80.4 | 87 | — | official官方榜 | source ↗×6 |
| 12 | GPT-5.6 TerraOpenAI | 78.4 | 85 | — | official官方榜 | source ↗×6⚠±9.6 |
| 13 | Gemini 3.6 FlashGoogle | 78 | 85 | 2026-07 | 3rd-party第三方 | source ↗×3⚠±4.22 |
| 14 | Gemini 3.5 FlashGoogle | 76.2 | 83 | 2026-07 | 3rd-party第三方 | source ↗×2 |
| 15 | GPT-5.6 LunaOpenAI | 75.7 | 82 | — | official官方榜 | source ↗×6⚠±9 |
| 16 | Claude Opus 4.8Anthropic | 74.6 | 81 | — | official官方榜 | source ↗×5⚠±10.4 |
| 17 | Qwen3.7 PlusQwen | 70.3 | 77 | — | 3rd-party第三方 | source ↗ |
| 18 | Qwen3.7 MaxQwen | 69.7 | 76 | 2026-06 | 3rd-party第三方 | source ↗×4⚠±4.8 |
| 19 | Gemini 3.1 Pro PreviewGoogle | 68.5 | 75 | — | official官方榜 | source ↗×6⚠±41.4 |
| 20 | DeepSeek V4 Pro 0423DeepSeek | 67.9⚡max | 74 | — | 3rd-party第三方 | source ↗×5⚠±36.4 |
| 21 | Kimi K2.7 CodeMoonshot AI | 66.7 | 73 | — | 3rd-party第三方 | source ↗ |
| 22 | MiniMax M3MiniMax | 66 | 72 | — | official官方榜 | source ↗×4 |
| 23 | Mistral Medium 3.5Mistral AI | 66 | 72 | — | 3rd-party第三方 | source ↗ |
| 24 | Mistral LargeMistral AI | 66 | 72 | 2026-08-01 | 3rd-party第三方 | source ↗×2⚠±42.25 |
| 25 | GLM 5.1Z.ai | 63.5 | 69 | 2026-07 | 3rd-party第三方 | source ↗×4⚠±7.3 |
| 26 | Step 3.7 FlashStepFun | 59.5 | 65 | — | 3rd-party第三方 | source ↗ |
| 27 | MiniMax M2.7MiniMax | 57 | 62 | — | official官方榜 | source ↗×3⚠±17.6 |
| 28 | Gemini 3.5 Flash LiteGoogle | 54 | 59 | — | 3rd-party第三方 | source ↗×2 |
| 29 | Grok 4.20xAI | 47.1⚡high | 51 | — | 3rd-party第三方 | source ↗ |
| 30 | DeepSeek V3.2DeepSeek | 46.4 | 50 | — | official官方榜 | source ↗×2 |
| 31 | Seed-2.0-LiteByteDance Seed | 45 | 49 | — | 3rd-party第三方 | source ↗ |
| 32 | Claude Opus 5Anthropic | 43.5⚡max | 47 | — | official官方榜 | source ↗×7⚠±46.4 |
| 33 | Grok 4.3xAI | 37.9 | 41 | — | 3rd-party第三方 | source ↗×2⚠±4.05 |
| 34 | Kimi K2 ThinkingMoonshot AI | 35.7⚡high | 39 | — | official官方榜 | source ↗×2 |
| 35 | Claude Haiku 4.5Anthropic | 27.5 | 30 | — | official官方榜 | source ↗×3⚠±13.5 |
| 36 | Mercury 2Inception | 26.5 | 29 | — | 3rd-party第三方 | source ↗ |
| 37 | gpt-oss-120bOpenAI | 18.7 | 20 | — | 3rd-party第三方 | source ↗ |
| 38 | Gemini 3.1 Flash LiteGoogle | 17.5 | 19 | — | 3rd-party第三方 | source ↗ |
| 39 | Llama 4 MaverickMeta | 8.8 | 10 | — | 3rd-party第三方 | source ↗ |
| 40 | Llama 4 ScoutMeta | 8.8 | 10 | — | 3rd-party第三方 | source ↗ |