Aller au contenu

Banc d’essai du terminal

Terminal Bench 2.1

Instantané du 2026-07-11 · 89 tâches · Source · Harness results from Terminal-Bench; costs are estimates / API blends.

Combinaison indicative de lignes Terminal-Bench 2.1 vérifiées par Snorkel et de chiffres publiés pour GPT-5.6. Les coûts sont des approximations fondées sur le chevauchement avec DeepSWE ou sur des estimations de tranches tarifaires API. Il ne s’agit pas de mesures OpenCodex en direct.

Les coûts de ce tableau sont des estimations ou des combinaisons de tarifs API. Le classement par score/dollar et l’indication du meilleur rapport qualité-prix restent désactivés tant que chaque ligne ne dispose pas d’un coût par tâche mesuré par la source.

ModèleNiveauScoreCoût par tâcheCas d’usage
gpt-5.6-solxhigh88.8%$8.39Pointe, Planification
gpt-5.6-terracodex78.4% ±1.3$4.95Polyvalent, Pointe
gpt-5.6-lunacodex75.7% ±1.3$3.03Polyvalent, Sous-agent économique
claude-fable-5claude-code83.8% ±1.2$21.63Planification, Pointe
gpt-5.5codex83.1% ±1.1$7.23Pointe, Polyvalent
grok-4.5cursor-cli79.3% ±1.5$2.42Polyvalent, Sous-agent économique
claude-opus-4.8claude-code78.9% ±1.3$13.22Pointe, Planification
muse-spark-1.1mini-swe-agent76.2% ±1.2$2.36Polyvalent, Sous-agent économique
claude-sonnet-5claude-code74.6% ±1.6$12Polyvalent
glm-5.2claude-code82.7%$3.92Polyvalent, Sous-agent économique
claude-opus-4.7claude-code68.9% ±1.4$10Pointe
gemini-3.1-progemini-cli65.8% ±1.7$9.48Pointe
kimi-k388.3%$5Pointe, Polyvalent
hy371.7%$2Sous-agent économique, Polyvalent
minimax-m366%$1.5Sous-agent économique