跳到內容

終端基準

Terminal Bench 2.1

快照 2026-07-11 · 89 項任務 · 來源 · Harness results from Terminal-Bench; costs are estimates / API blends.

Snorkel 驗證的 Terminal-Bench 2.1 行與已釋出 GPT-5.6 資料的示意混合。成本為近似代理。非 OpenCodex 即時計量。

此榜單的成本為估算或 API 單價合成——在每一行都有來源實測的每任務成本之前,停用分數/$ 排名與“最佳性價比”。

模型推理力度得分每任務成本用途
gpt-5.6-solxhigh88.8%$8.39前沿, 規劃
gpt-5.6-terracodex78.4% ±1.3$4.95主力, 前沿
gpt-5.6-lunacodex75.7% ±1.3$3.03主力, 低價子代理
claude-fable-5claude-code83.8% ±1.2$21.63規劃, 前沿
gpt-5.5codex83.1% ±1.1$7.23前沿, 主力
grok-4.5cursor-cli79.3% ±1.5$2.42主力, 低價子代理
claude-opus-4.8claude-code78.9% ±1.3$13.22前沿, 規劃
muse-spark-1.1mini-swe-agent76.2% ±1.2$2.36主力, 低價子代理
claude-sonnet-5claude-code74.6% ±1.6$12主力
glm-5.2claude-code82.7%$3.92主力, 低價子代理
claude-opus-4.7claude-code68.9% ±1.4$10前沿
gemini-3.1-progemini-cli65.8% ±1.7$9.48前沿
kimi-k388.3%$5前沿, 主力
hy371.7%$2低價子代理, 主力
minimax-m366%$1.5低價子代理