2026年全球编程大模型排行榜
2026-09-24 整理。Terminal-Bench 4.0 官方榜:GPT-6 Astra(max)配 Codex 解决率 58.2%。同一套 mini-SWE-agent 2.0.0 在 SWE-bench Verified 上另表。

2026-09-24 整理。主表照抄 Terminal-Bench 4.0 官方榜,榜单记录更新于 2026-09-21。一行是一次提交:模型、推理档位和代理一起计分。GPT-6 Astra(max)配 Codex,解决率 58.2%,95% 区间半宽 2.8 个百分点。Fable 5.1(max)配 Claude Code 是 57.9%,半宽 3.8 个百分点,两行的区间叠在一起。编程产品见 AI 编程助手。人气盲测见 大语言模型综合能力。接口标价见 大模型 API 价格。

Terminal-Bench 4.0 官方榜
这一表是该榜当时全部 27 行。并列名次按原榜保留。花费是这次评测的总账单,按 total_cost_usd 四舍五入到美元。GLM-5.3(max)配 Claude Code 排在第 16,解决率 41.8%。Grok 4.7(xhigh)配 Grok Build 的提交日是 2026-09-21,解决率 37.6%。
| # | 模型 | 档位 | 代理 | 机构 | 解决率 | 95% 半宽 | 花费 | Token | 提交日 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | max | Codex | OpenAI | 58.2% | ±2.8 | $3,267 | 1.5B | Sep 3, 2026 |
| 2 | Fable 5.1 | max | Claude Code | Anthropic | 57.9% | ±3.8 | $6,244 | 2.7B | Sep 1, 2026 |
| 2 | GPT-6 Astra | xhigh | Codex | OpenAI | 57.9% | ±2.7 | $2,351 | 1.2B | Sep 3, 2026 |
| 2 | GPT-6 Astra | high | Codex | OpenAI | 57.9% | ±3.0 | $2,269 | 1.2B | Sep 3, 2026 |
| 2 | Fable 5.1 | xhigh | Claude Code | Anthropic | 57.9% | ±3.4 | $4,872 | 2.3B | Sep 1, 2026 |
| 6 | Fable 5.1 | high | Claude Code | Anthropic | 54.5% | ±3.4 | $3,985 | 2.2B | Sep 1, 2026 |
| 7 | GPT-6 Astra | medium | Codex | OpenAI | 54.2% | ±2.7 | $1,915 | 1.1B | Sep 3, 2026 |
| 8 | Fable 5.1 | medium | Claude Code | Anthropic | 53.9% | ±3.4 | $2,833 | 1.6B | Sep 1, 2026 |
| 8 | Opus 5 | xhigh | Claude Code | Anthropic | 53.9% | ±3.2 | $6,086 | 6.9B | Jul 24, 2026 |
| 10 | Opus 5 | max | Claude Code | Anthropic | 51.8% | ±3.4 | $5,969 | 6.5B | Jul 24, 2026 |
| 11 | GPT-6 Astra | low | Codex | OpenAI | 50.6% | ±2.8 | $1,557 | 889.8M | Sep 3, 2026 |
| 12 | Opus 5 | high | Claude Code | Anthropic | 50.3% | ±3.7 | $4,662 | 5.5B | Jul 24, 2026 |
| 13 | Opus 5 | medium | Claude Code | Anthropic | 44.9% | ±3.8 | $3,192 | 3.7B | Jul 24, 2026 |
| 14 | Fable 5 | max | Claude Code | Anthropic | 44.5% | ±3.9 | $7,265 | 3.8B | Jun 9, 2026 |
| 15 | Fable 5.1 | low | Claude Code | Anthropic | 43.3% | ±3.6 | $2,359 | 1.3B | Sep 1, 2026 |
| 16 | GLM-5.3 | max | Claude Code | Z.ai | 41.8% | ±3.2 | $2,728 | 8.7B | Aug 14, 2026 |
| 17 | Grok 4.7 | xhigh | Grok Build | xAI | 37.6% | ±3.5 | $3,683 | 5.5B | Sep 21, 2026 |
| 18 | GPT-5.6 Sol | max | Codex | OpenAI | 37.3% | ±3.8 | $2,542 | 4.4B | Jun 26, 2026 |
| 19 | Opus 5 | low | Claude Code | Anthropic | 34.9% | ±3.9 | $2,394 | 2.7B | Jul 24, 2026 |
| 20 | Opus 4.8 | max | Claude Code | Anthropic | 23.6% | ±3.6 | $6,481 | 6.4B | May 28, 2026 |
| 21 | GPT-5.6 Terra | max | Codex | OpenAI | 21.5% | ±3.2 | $1,734 | 5.7B | Jun 26, 2026 |
| 22 | Grok 4.6 | high | Grok Build | xAI | 20.3% | ±3.1 | $3,592 | 4.0B | Aug 12, 2026 |
| 23 | Gemini 3.8 Flash | high | mini-SWE-agent | 19.1% | ±3.4 | $1,829 | 17.2B | Sep 2, 2026 | |
| 24 | GPT-5.6 Luna | max | Codex | OpenAI | 17.3% | ±2.9 | $347 | 11.6B | Jun 26, 2026 |
| 25 | Grok 4.5 | high | Grok Build | xAI | 12.4% | ±2.6 | $2,094 | 3.4B | Jul 16, 2026 |
| 25 | Sonnet 5 | max | Claude Code | Anthropic | 12.4% | ±3.1 | $9,604 | 21.6B | Jun 30, 2026 |
| 27 | Gemini 3.7 Flash | high | mini-SWE-agent | 11.2% | ±2.5 | $1,262 | 11.1B | Aug 13, 2026 |
SWE-bench Verified:同一代理 mini-SWE-agent 2.0.0
官方总榜把不同代理叠在一起。下面只留 bash-only、且代理版本为 mini-SWE-agent 2.0.0 的提交,再按解决率从高到低排。Claude 4.5 Opus(high)76.80%,平均花费 $0.75,提交日 2026-02-17。MiniMax M2.5(high)和 Gemini 3 Flash(high)都是 75.80%。Kimi K2.5(high)70.80%,平均 $0.15。DeepSeek V3.2(high)70.00%。
| # | 模型 | 档位 | 解决率 | 平均花费 | 提交日 |
|---|---|---|---|---|---|
| 1 | Claude 4.5 Opus | high | 76.80% | $0.75 | 2026-02-17 |
| 2 | Gemini 3 Flash | high | 75.80% | $0.36 | 2026-02-17 |
| 3 | MiniMax M2.5 | high | 75.80% | $0.07 | 2026-02-17 |
| 4 | Claude 4.6 Opus | — | 75.60% | $0.55 | 2026-02-17 |
| 5 | GLM 5 | high | 72.80% | $0.53 | 2026-02-17 |
| 6 | GPT 5.2 | high | 72.80% | $0.47 | 2026-02-17 |
| 7 | GPT 5.2 Codex | — | 72.80% | $0.45 | 2026-02-19 |
| 8 | Claude 4.5 Sonnet | high | 71.40% | $0.66 | 2026-02-17 |
| 9 | Kimi K2.5 | high | 70.80% | $0.15 | 2026-02-17 |
| 10 | DeepSeek V3.2 | high | 70.00% | $0.45 | 2026-02-17 |
| 11 | Gemini 3 Pro | high | 69.60% | $0.96 | 2026-02-26 |
| 12 | GPT 5 mini | — | 56.20% | $0.05 | 2026-02-17 |
LiveCodeBench 默认窗口(止于 2025-05-01)
默认榜写出 454 题,题目日期从 2024-08-01 到 2025-05-01。o4-mini(high)Pass@1 为 80.2,Easy 99.1,Hard 63.5。DeepSeek-R1-0528 排在第 5,Pass@1 为 73.1。这张表的模型代际停在窗口截止日,后面发布的 Astra、Fable 5.1、Opus 5 不在上面。
| # | 模型 | 档位 | Pass@1 | Easy | Medium | Hard |
|---|---|---|---|---|---|---|
| 1 | o4-mini | high | 80.2 | 99.1 | 89.4 | 63.5 |
| 2 | o3 | high | 75.8 | 99.1 | 84.4 | 57.1 |
| 3 | o4-mini | medium | 74.2 | 98.2 | 86.5 | 52.7 |
| 4 | Gemini 2.5 Pro | 06-05 | 73.6 | 99.1 | 87.2 | 50.2 |
| 5 | DeepSeek-R1-0528 | — | 73.1 | 98.7 | 85.2 | 50.7 |
| 6 | Gemini 2.5 Pro | 05-06 | 71.8 | 98.2 | 82.3 | 50.2 |
| 7 | EXAONE 4.0 32B | — | 70 | 98.4 | 82.3 | 46.2 |
| 8 | OpenReasoning-Nemotron-32B | — | 69.8 | 98.3 | 81.4 | 46.3 |
这篇怎么排
整理日 2026-09-24。主表是 Terminal-Bench 页内标题为 Terminal-Bench 4.0 的官方榜,榜单记录更新于 2026-09-21。27 行全部收录。解决率、95% 区间半宽、花费、Token、提交日从该榜 JSON 照抄。花费取 total_cost_usd,四舍五入到美元。第二张表只收 SWE-bench Verified、bash-only、代理为 mini-SWE-agent 2.0.0 的行,按解决率从高到低重排,名次是这 12 行内部的顺序。第三张表是 LiveCodeBench 默认窗口,题目日期 2024-08-01 至 2025-05-01,共 454 题,模型代际停在 2025 年 5 月,不并进主表。
| 来源 | 快照 | 口径 | 权重 |
|---|---|---|---|
| Terminal-Bench 4.0 官方榜 | 页抓取 2026-09-24;榜单 updated_at 2026-09-21 | 终端任务解决率。一行是模型 + 推理档位 + 代理。GPT-6 Astra(max)+ Codex 58.2%(±2.8),n_trials 330。榜上 27 行全收 | 主 |
| SWE-bench Verified(bash-only) | 页抓取 2026-09-24;本表各行提交日 2026-02-17 至 2026-02-26 | 只留 mini-SWE-agent 2.0.0。Claude 4.5 Opus(high)76.80%,平均 $0.75。官方总榜还混有别的代理,那些行不进这张表 | 辅 |
| LiveCodeBench | 默认窗口 2024-08-01 至 2025-05-01;抓取 2026-09-24 | 竞赛编程 Pass@1。o4-mini(high)80.2。窗口截止后的模型不在这张默认榜上 | 辅(旧窗口) |
互动体验:拖拽排位《2026年全球编程大模型天梯榜》
2026年全球编程大模型天梯榜
想打造自己的个性化天梯图并开放给读者嵌入吗?