安全基準
Cybench
Cybench unguided 解決率示意。成本為相對估計。轉載請引用 Cybench。非 OpenCodex 即時計量。
此榜單的成本為估算或 API 單價合成——在每一行都有來源實測的每任務成本之前,停用分數/$ 排名與“最佳性價比”。
| 模型 | 推理力度 | 得分 | 每任務成本 | 用途 |
|---|---|---|---|---|
| claude-mythos-preview | — | 100% | $18 | 前沿, 規劃 |
| claude-opus-4.7 | — | 96% | $14 | 前沿, 規劃 |
| claude-opus-4.6 | — | 93% | $12 | 前沿, 規劃 |
| claude-opus-4.5 | — | 82% | $11 | 前沿 |
| muse-spark | — | 65.4% | $3.2 | 主力, 前沿 |
| claude-sonnet-4.5 | — | 60% | $5.5 | 主力 |
| grok-4 | — | 43% | $2.8 | 主力, 低價子代理 |
| claude-opus-4.1 | — | 42% | $9 | 主力 |
| grok-4.1 | thinking | 39% | $2.4 | 主力, 低價子代理 |
| claude-opus-4 | — | 38% | $8 | 主力 |
| claude-sonnet-4 | — | 35% | $4.5 | 主力 |
| grok-4 | fast | 30% | $1.2 | 快速, 低價子代理 |
| o3-mini | — | 22.5% | $1.5 | 低價子代理 |
| claude-3.7-sonnet | — | 20% | $3.5 | 主力 |
| gpt-4.5-preview | — | 17.5% | $6 | 前沿 |

