セキュリティベンチマーク
Cybench
cybench.github.io の参考スナップショット(プロフェッショナル CTF タスクの unguided 解決率)。多くの行は system card の結果またはサブセットの結果であり、一つの統一フルスイート実行ではありません。コストはエージェント実行の相対推定です — Cybench は $/task を公開していません。OpenCodex のライブ計測ではありません。
このボードのコストは推定または API 価格の合成です — すべての行にソース実測のタスクあたりコストがない限り、スコア/$ ランキングと「最高コスパ」は無効になります。
| モデル | 推論負荷 | スコア | コスト / タスク | 用途 |
|---|---|---|---|---|
| claude-mythos-preview | — | 100% | $18 | フロンティア, プランナー |
| claude-opus-4.7 | — | 96% | $14 | フロンティア, プランナー |
| claude-opus-4.6 | — | 93% | $12 | フロンティア, プランナー |
| claude-opus-4.5 | — | 82% | $11 | フロンティア |
| muse-spark | — | 65.4% | $3.2 | 主力, フロンティア |
| claude-sonnet-4.5 | — | 60% | $5.5 | 主力 |
| grok-4 | — | 43% | $2.8 | 主力, 低価サブエージェント |
| claude-opus-4.1 | — | 42% | $9 | 主力 |
| grok-4.1 | thinking | 39% | $2.4 | 主力, 低価サブエージェント |
| claude-opus-4 | — | 38% | $8 | 主力 |
| claude-sonnet-4 | — | 35% | $4.5 | 主力 |
| grok-4 | fast | 30% | $1.2 | 高速, 低価サブエージェント |
| o3-mini | — | 22.5% | $1.5 | 低価サブエージェント |
| claude-3.7-sonnet | — | 20% | $3.5 | 主力 |
| gpt-4.5-preview | — | 17.5% | $6 | フロンティア |

