Banc d’essai de sécurité
Cybench
Instantané indicatif de cybench.github.io : pourcentage de tâches CTF professionnelles résolues sans aide. De nombreuses lignes proviennent de fiches système ou de sous-ensembles, et non d’une exécution uniforme de la suite complète. Les coûts sont des estimations relatives d’exécution d’agent, car Cybench ne publie pas de coût par tâche. Il ne s’agit pas de mesures OpenCodex en direct.
Les coûts de ce tableau sont des estimations ou des combinaisons de tarifs API. Le classement par score/dollar et l’indication du meilleur rapport qualité-prix restent désactivés tant que chaque ligne ne dispose pas d’un coût par tâche mesuré par la source.
| Modèle | Niveau | Score | Coût par tâche | Cas d’usage |
|---|---|---|---|---|
| claude-mythos-preview | — | 100% | $18 | Pointe, Planification |
| claude-opus-4.7 | — | 96% | $14 | Pointe, Planification |
| claude-opus-4.6 | — | 93% | $12 | Pointe, Planification |
| claude-opus-4.5 | — | 82% | $11 | Pointe |
| muse-spark | — | 65.4% | $3.2 | Polyvalent, Pointe |
| claude-sonnet-4.5 | — | 60% | $5.5 | Polyvalent |
| grok-4 | — | 43% | $2.8 | Polyvalent, Sous-agent économique |
| claude-opus-4.1 | — | 42% | $9 | Polyvalent |
| grok-4.1 | thinking | 39% | $2.4 | Polyvalent, Sous-agent économique |
| claude-opus-4 | — | 38% | $8 | Polyvalent |
| claude-sonnet-4 | — | 35% | $4.5 | Polyvalent |
| grok-4 | fast | 30% | $1.2 | Rapide, Sous-agent économique |
| o3-mini | — | 22.5% | $1.5 | Sous-agent économique |
| claude-3.7-sonnet | — | 20% | $3.5 | Polyvalent |
| gpt-4.5-preview | — | 17.5% | $6 | Pointe |

