Aller au contenu

Bancs d’essai de programmation

DeepSWE

Instantané du 2026-07-16 · 113 tâches · Source · Public leaderboard snapshot; verify current rankings on the source before citing.

Instantané indicatif du classement public DeepSWE avec mini-swe-agent. Les scores et les coûts ne proviennent pas de mesures OpenCodex en direct.

ModèleNiveauScoreCoût par tâcheScore par dollarCas d’usage
gpt-5.6-solmax73% ±3$8.398.7Pointe, Planification
claude-fable-5max70% ±4$21.633.2Planification, Pointe
gpt-5.6-terramax70% ±3$4.9514.1Polyvalent, Pointe
gpt-5.6-lunamax67% ±4$3.0322.1Polyvalent, Sous-agent économique
gpt-5.5xhigh67% ±6$7.239.3Pointe, Polyvalent
claude-opus-4.8max59% ±2$13.224.5Pointe, Planification
claude-sonnet-5max54% ±4$26.42.0Planification
grok-4.5high54% ±2$2.4222.3Polyvalent, Sous-agent économique
muse-spark-1.1Meilleur rapport qualité-prixxhigh53% ±3$2.3622.5Polyvalent, Sous-agent économique
gpt-5.4xhigh52% ±2$5.659.2Polyvalent
glm-5.2max44% ±2$3.9211.2Polyvalent, Sous-agent économique
gemini-3.5-flashmedium37% ±2$7.345.0Rapide
kimi-k2.7-code31% ±1$2.8211.0Sous-agent économique, Polyvalent
claude-sonnet-4.6high30% ±4$5.525.4Polyvalent
gemini-3.1-prohigh12% ±2$9.481.3Pointe

AA Coding Agent

Instantané du 2026-07-09 · undefined tâches · Source · Figures from Artificial Analysis public pages; not affiliated with AA.

Instantané de l’Artificial Analysis Coding Agent Index après la disponibilité générale de GPT-5.6, le 9 juillet 2026. Consultez provenance.url. Il ne s’agit pas de mesures OpenCodex en direct.

ModèleNiveauScoreCoût par tâcheScore par dollarCas d’usage
composer-2.5Meilleur rapport qualité-prixstd62$0.07885.7Polyvalent, Sous-agent économique, Rapide
composer-2.5fast62$0.44140.9Polyvalent, Rapide
claude-opus-4.7max66$4.116.1Pointe, Planification
gpt-5.5xhigh65$4.8213.5Pointe, Polyvalent
gpt-5.6-lunamax75$1.5548.4Polyvalent, Sous-agent économique
gpt-5.6-terramax77$2.432.1Polyvalent
gpt-5.6-solmax80$3.920.5Pointe, Planification
grok-4.5high76$2.5429.9Polyvalent, Sous-agent économique
claude-sonnet-4.6high58$2.820.7Polyvalent
claude-fable-5high64$9.56.7Planification, Pointe

FrontierCode

Instantané du 2026-07-16 · 100 tâches · Source · Public FrontierCode snapshot; verify on cognition.com before citing.

Instantané indicatif de cognition.com/frontiercode, FrontierCode 1.1 Main, juillet 2026. Le score suit la grille de mergeability et le coût est la moyenne en USD par exécution. Les modes de raisonnement Meilleur et Tous correspondent au sélecteur du classement Cognition. Il ne s’agit pas de mesures OpenCodex en direct.

ModèleNiveauScoreCoût par tâcheScore par dollarCas d’usage
claude-fable-5xhigh53.5%$13.094.1Pointe, Polyvalent, Planification
claude-fable-5high52.7%$9.485.6Pointe, Polyvalent, Planification
claude-fable-5max51.6%$19.072.7Pointe, Polyvalent, Planification
claude-fable-5medium49.8%$7.157.0Pointe, Polyvalent, Planification
claude-fable-5low48%$4.929.8Pointe, Polyvalent, Planification
gpt-5.6-solmax47.5%$6.37.5Pointe, Polyvalent, Planification
gpt-5.6-solxhigh46.8%$59.4Pointe, Polyvalent, Planification
claude-opus-4.8max46.5%$9.624.8Pointe, Polyvalent, Planification
claude-opus-4.8xhigh45.5%$6.786.7Pointe, Polyvalent, Planification
gpt-5.6-solhigh45.1%$4.111.0Pointe, Polyvalent, Planification
gpt-5.5xhigh43%$4.0310.7Pointe, Polyvalent
claude-sonnet-5xhigh42.7%$9.064.7Pointe, Polyvalent
grok-4.5high42.4%$1.332.6Polyvalent, Sous-agent économique, Rapide
claude-sonnet-5max42.4%$15.42.8Pointe, Polyvalent
swe-1.742.3%$1.9721.5Polyvalent, Sous-agent économique
grok-4.5medium41.9%$1.234.9Polyvalent, Sous-agent économique, Rapide
gpt-5.6-terramax41.3%$2.318.0Polyvalent
claude-opus-4.8high41%$4.289.6Pointe, Polyvalent, Planification
gpt-5.5high40.6%$3.1213.0Pointe, Polyvalent
claude-opus-4.8medium40.5%$3.710.9Pointe, Polyvalent, Planification
gpt-5.6-solmedium39.9%$3.112.9Pointe, Polyvalent, Planification
gpt-5.6-lunamax39.8%$1.822.1Polyvalent, Sous-agent économique
claude-sonnet-5high39.4%$5.497.2Pointe, Polyvalent
gpt-5.6-lunaxhigh38.9%$1.525.9Polyvalent, Sous-agent économique
gpt-5.6-terraxhigh38.7%$1.624.2Polyvalent, Sous-agent économique
claude-opus-4.7max38.5%$9.094.2Polyvalent
grok-4.5low37.9%$0.847.4Polyvalent, Sous-agent économique, Rapide
gpt-5.6-terrahigh36.9%$1.426.4Polyvalent, Sous-agent économique, Rapide
gpt-5.5medium36.6%$2.3515.6Pointe, Polyvalent
gpt-5.6-lunahigh35.9%$1.132.6Polyvalent, Sous-agent économique, Rapide
gpt-5.6-sollow35.4%$2.116.9Pointe, Polyvalent, Planification
claude-sonnet-5medium35.2%$3.4310.3Pointe, Polyvalent
claude-opus-4.7high35.2%$5.037.0Polyvalent
claude-opus-4.8low35.1%$2.6813.1Pointe, Polyvalent, Planification
claude-opus-4.7xhigh34.9%$6.875.1Polyvalent
gpt-5.6-terramedium33.9%$0.937.7Polyvalent, Sous-agent économique, Rapide
gpt-5.5low30.6%$1.6518.5Pointe, Polyvalent, Sous-agent économique
kimi-k2.730.1%$3.0110.0
claude-opus-4.7medium28.9%$3.229.0Polyvalent
claude-sonnet-5low28.7%$2.1513.3Pointe, Polyvalent
claude-opus-4.7low27.6%$2.4711.2Polyvalent
gpt-5.6-lunamedium25.7%$0.642.8Polyvalent, Sous-agent économique, Rapide
composer-2.525.6%$3.098.3
glm-5.224.5%$2.479.9
gpt-5.6-terralow24.1%$0.548.2Polyvalent, Sous-agent économique, Rapide
deepseek-v4-pro17.6%$1.611.0Sous-agent économique
gpt-5.6-lunaMeilleur rapport qualité-prixlow15.4%$0.277.0Polyvalent, Sous-agent économique, Rapide
minimax-m314.7%$0.721.0Sous-agent économique, Rapide
inkling0.9914%$3.63.9
qwen-3.7-plus10.2%$0.251.0Sous-agent économique, Rapide

FrontierSWE

Instantané du 2026-07-16 · undefined tâches · Source · Scores from FrontierSWE; costs are illustrative API/relative blends, not measured $/task.

Instantané indicatif de frontierswe.com selon la dominance Mean@5. L’axe horizontal utilise un tarif API public combiné en $/MTok comme indicateur de coût relatif, et non un coût par tâche mesuré. Il ne s’agit pas de mesures OpenCodex en direct.

Les coûts de ce tableau sont des estimations ou des combinaisons de tarifs API. Le classement par score/dollar et l’indication du meilleur rapport qualité-prix restent désactivés tant que chaque ligne ne dispose pas d’un coût par tâche mesuré par la source.

ModèleNiveauScoreCoût par tâcheCas d’usage
claude-fable-5claude-code89%$30Planification, Pointe
grok-4.5grok-cli78%$4Polyvalent, Pointe
claude-opus-4.8claude-code73%$15Pointe, Planification
glm-5.2claude-code72%$1.98Polyvalent, Sous-agent économique
gpt-5.5codex70%$17.5Pointe, Polyvalent
claude-opus-4.7claude-code61%$15Pointe
claude-opus-4.6claude-code53%$15Polyvalent
gpt-5.4codex51%$8.75Polyvalent
composer-2.5cursor-cli38%$1Polyvalent, Sous-agent économique, Rapide
gemini-3.1-progemini-cli37%$8.75Pointe
glm-5.1claude-code29%$2.9Polyvalent
deepseek-v4-proclaude-code27%$2.4Sous-agent économique, Polyvalent
kimi-k2.6kimi-cli25%$2.13Sous-agent économique
kimi-k2.5kimi-cli25%$2.13Sous-agent économique
qwen3.6-plusqwen-code21%$1.75Sous-agent économique

Program Bench

Instantané du 2026-06-23 · 200 tâches · Source · Scores and average API costs from ProgramBench extended leaderboard.

Instantané du classement étendu de programbench.com avec mini-SWE-agent sur 200 tâches. Le score « presque résolu » correspond à au moins 95 % de tests réussis ; les coûts sont les moyennes API publiées par tâche. Il ne s’agit pas de mesures OpenCodex en direct.

ModèleNiveauScoreCoût par tâcheScore par dollarCas d’usage
gpt-5.5Meilleur rapport qualité-prixxhigh13.5%$8.851.5Pointe, Planification
gpt-5.5high5%$3.651.4Pointe, Polyvalent
claude-opus-4.7xhigh4.5%$10.960.4Planification, Pointe
claude-opus-4.73%$3.810.8Pointe
claude-opus-4.62.5%$11.380.2Polyvalent
gpt-5.51.5%$1.211.2Polyvalent
claude-sonnet-4.61%$26.730.0Polyvalent
gpt-5.40%$0.330.0Rapide, Sous-agent économique
gemini-3.1-pro0%$1.510.0Pointe
gemini-3-flash0%$0.30.0Rapide, Sous-agent économique
claude-haiku-4.50%$0.80.0Rapide, Sous-agent économique
gpt-5.4-mini0%$0.040.0Rapide, Sous-agent économique
gpt-5-mini0%$0.030.0Rapide, Sous-agent économique

SWE Marathon

Instantané du 2026-07-09 · 20 tâches · Source · Scores from SWE-Marathon; costs are estimates.

Instantané indicatif de swe-marathon.org : pass@1 sur 20 tâches à très long horizon. L’axe des coûts représente un coût d’exécution relatif estimé pour de longues trajectoires, et non un coût par tâche publié. Il ne s’agit pas de mesures OpenCodex en direct.

Les coûts de ce tableau sont des estimations ou des combinaisons de tarifs API. Le classement par score/dollar et l’indication du meilleur rapport qualité-prix restent désactivés tant que chaque ligne ne dispose pas d’un coût par tâche mesuré par la source.

ModèleNiveauScoreCoût par tâcheCas d’usage
grok-4.5grok-build29%$8Pointe, Planification
claude-opus-4.8claude-code26%$28Pointe, Planification
claude-fable-5claude-code24%$45Planification, Pointe
claude-opus-4.7claude-code16%$22Pointe
glm-5.2claude-code13%$6Polyvalent, Sous-agent économique
gpt-5.5codex12%$18Pointe, Polyvalent
claude-opus-4.7terminus-211%$20Polyvalent
gemini-3.5-flashgemini-cli7%$5Rapide
gpt-5.5terminus-26%$16Polyvalent
gemini-3.1-proterminus-24%$12Pointe
deepseek-v4-proterminus-24%$7Sous-agent économique
gemini-3.1-progemini-cli2%$12Pointe
glm-5.1terminus-21%$5Polyvalent
minimax-m2.7terminus-20%$3Sous-agent économique
kimi-k2.6kimi-cli0%$4Sous-agent économique