Banc d’essai du terminal
Terminal Bench 2.1
Combinaison indicative de lignes Terminal-Bench 2.1 vérifiées par Snorkel et de chiffres publiés pour GPT-5.6. Les coûts sont des approximations fondées sur le chevauchement avec DeepSWE ou sur des estimations de tranches tarifaires API. Il ne s’agit pas de mesures OpenCodex en direct.
Les coûts de ce tableau sont des estimations ou des combinaisons de tarifs API. Le classement par score/dollar et l’indication du meilleur rapport qualité-prix restent désactivés tant que chaque ligne ne dispose pas d’un coût par tâche mesuré par la source.
| Modèle | Niveau | Score | Coût par tâche | Cas d’usage |
|---|---|---|---|---|
| gpt-5.6-sol | xhigh | 88.8% | $8.39 | Pointe, Planification |
| gpt-5.6-terra | codex | 78.4% ±1.3 | $4.95 | Polyvalent, Pointe |
| gpt-5.6-luna | codex | 75.7% ±1.3 | $3.03 | Polyvalent, Sous-agent économique |
| claude-fable-5 | claude-code | 83.8% ±1.2 | $21.63 | Planification, Pointe |
| gpt-5.5 | codex | 83.1% ±1.1 | $7.23 | Pointe, Polyvalent |
| grok-4.5 | cursor-cli | 79.3% ±1.5 | $2.42 | Polyvalent, Sous-agent économique |
| claude-opus-4.8 | claude-code | 78.9% ±1.3 | $13.22 | Pointe, Planification |
| muse-spark-1.1 | mini-swe-agent | 76.2% ±1.2 | $2.36 | Polyvalent, Sous-agent économique |
| claude-sonnet-5 | claude-code | 74.6% ±1.6 | $12 | Polyvalent |
| glm-5.2 | claude-code | 82.7% | $3.92 | Polyvalent, Sous-agent économique |
| claude-opus-4.7 | claude-code | 68.9% ±1.4 | $10 | Pointe |
| gemini-3.1-pro | gemini-cli | 65.8% ±1.7 | $9.48 | Pointe |
| kimi-k3 | — | 88.3% | $5 | Pointe, Polyvalent |
| hy3 | — | 71.7% | $2 | Sous-agent économique, Polyvalent |
| minimax-m3 | — | 66% | $1.5 | Sous-agent économique |

