Agent · weight 5%智能体 · 权重 5%
τ²-bench
What it tests: Tool-calling agent evaluation in realistic customer-service domains (airline, retail, telecom). The agent must use APIs, follow policies, and handle multi-turn user interactions.
考什么:仿真客服场景的工具调用评测(航空/零售/电信):agent 必须正确调 API、遵守业务规则、处理多轮用户对话。
Why it counts: The most practical agent benchmark — it predicts whether a model will reliably drive tools in production, which raw chat benchmarks can't tell you.
为什么算数:最实用的 Agent benchmark——能预测模型在生产环境调工具的可靠性,这是聊天类 benchmark 看不出来的。
| Maintainer维护方 | Sierra(Anthropic 系创业公司) |
|---|---|
| License许可 | MIT |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 70 |
◈
Standings实时排名
30 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | GLM 5.2Z.ai | 99.1⚡max | 100 | — | 3rd-party第三方 | source ↗×4 |
| 2 | Claude Fable 5Anthropic | 98.5 | 99 | — | 3rd-party第三方 | source ↗×4 |
| 3 | Step 3.7 FlashStepFun | 98.5 | 99 | — | 3rd-party第三方 | source ↗×3 |
| 4 | Grok 4.3xAI | 97.7 | 99 | — | 3rd-party第三方 | source ↗×3 |
| 5 | GLM 5.1Z.ai | 97.7⚡high | 99 | — | 3rd-party第三方 | source ↗×3 |
| 6 | DeepSeek V4 Pro 0423DeepSeek | 96.2 | 97 | — | 3rd-party第三方 | source ↗×3 |
| 7 | Gemini 3.1 Pro PreviewGoogle | 95.6 | 96 | — | 3rd-party第三方 | source ↗×5⚠±3.7 |
| 8 | DeepSeek V4 Flash 0423DeepSeek | 95.6⚡high | 96 | — | 3rd-party第三方 | source ↗×2 |
| 9 | Gemini 3.5 FlashGoogle | 95.3 | 96 | — | 3rd-party第三方 | source ↗ |
| 10 | Qwen3.7 MaxQwen | 94.7 | 96 | — | 3rd-party第三方 | source ↗×2⚠±4.1 |
| 11 | Claude Opus 4.8Anthropic | 94.4 | 95 | — | 3rd-party第三方 | source ↗×2 |
| 12 | Seed-2.0-LiteByteDance Seed | 94.2 | 95 | — | vendor-reported厂商自报 | source ↗ |
| 13 | Mistral Medium 3.5Mistral AI | 94.2 | 95 | — | 3rd-party第三方 | source ↗×3 |
| 14 | Kimi K3Moonshot AI | 93 | 94 | — | 3rd-party第三方 | source ↗ |
| 15 | Qwen3.7 PlusQwen | 93 | 94 | — | 3rd-party第三方 | source ↗ |
| 16 | Kimi K2 ThinkingMoonshot AI | 93⚡high | 94 | — | 3rd-party第三方 | source ↗ |
| 17 | DeepSeek V3.2DeepSeek | 91⚡high | 92 | 2025-12-01 | 3rd-party第三方 | source ↗×3⚠±5.2 |
| 18 | Kimi K2.7 CodeMoonshot AI | 90.1 | 91 | — | 3rd-party第三方 | source ↗×2 |
| 19 | MiniMax M3MiniMax | 88.9 | 90 | — | 3rd-party第三方 | source ↗×2 |
| 20 | GPT-5.6 TerraOpenAI | 86.3 | 87 | — | 3rd-party第三方 | source ↗ |
| 21 | GPT-5.6 SolOpenAI | 85.1 | 86 | — | 3rd-party第三方 | source ↗×2 |
| 22 | Command ACohere | 85 | 86 | — | 3rd-party第三方 | source ↗×3⚠±48 |
| 23 | MiniMax M2.7MiniMax | 84.8 | 86 | — | 3rd-party第三方 | source ↗×2 |
| 24 | Claude Opus 5Anthropic | 82.78 | 84 | — | 3rd-party第三方 | source ↗ |
| 25 | Claude Sonnet 5Anthropic | 80.4 | 81 | — | 3rd-party第三方 | source ↗ |
| 26 | GPT-5.5OpenAI | 46.39 | 47 | 2026-03-11 | official官方榜 | source ↗×5⚠±51.61 |
| 27 | Mistral Small 4Mistral AI | 41.2 | 42 | — | 3rd-party第三方 | source ↗ |
| 28 | Claude Haiku 4.5Anthropic | 39.5 | 40 | — | 3rd-party第三方 | source ↗×2⚠±43.5 |
| 29 | Llama 4 MaverickMeta | 17.8 | 18 | — | 3rd-party第三方 | source ↗ |
| 30 | Llama 4 ScoutMeta | 15.5 | 16 | — | 3rd-party第三方 | source ↗ |