01Leaderboard
Updated Jun 28, 2026Mean effective score across all 12 tasks. Source: Table 3 in the paper.
| # | Agent | Model | Mean score | |
|---|---|---|---|---|
| 1 | Claude Code | Claude Opus 4.7Anthropic | 90.1% | |
| 2 | Codex | GPT-5.5OpenAI | 86.1% | |
| 3 | Claude Code | Claude Opus 4.8Anthropic | 85.7% | |
| 4 | Cursor CLI | Auto* · routerCursor | 81.1% | |
| 5 | Gemini CLI | Gemini 3.5 FlashGoogle | 78.1% | |
| 6 | Cursor CLI | Composer 2.5Cursor | 74.6% | |
| 7 | OpenCode | DeepSeek V4 FlashDeepSeek | 65.5% | |
| 8 | OpenCode | MiMo V2.5 ProXiaomi | 60.9% | |
| 9 | OpenCode | MiMo V2.5Xiaomi | 60.6% | |
| 10 | Claude Code | Claude Sonnet 4.6Anthropic | 59.2% | |
| 11 | OpenCode | DeepSeek V4 ProDeepSeek | 49.8% | |
| — | OpenCode | GLM 5.2Zhipu | in eval | |
| — | Kimi Code | Kimi 2.7 CodeMoonshot | in eval |
* Auto is Cursor's built-in model router, not a fixed checkpoint. Kimi 2.7 Code and GLM 5.2 evaluations are in progress.