Bancs d’essai de programmation
DeepSWE
Instantané indicatif du classement public DeepSWE avec mini-swe-agent. Les scores et les coûts ne proviennent pas de mesures OpenCodex en direct.
| Modèle | Niveau | Score | Coût par tâche | Score par dollar | Cas d’usage |
|---|---|---|---|---|---|
| gpt-5.6-sol | max | 73% ±3 | $8.39 | 8.7 | Pointe, Planification |
| claude-fable-5 | max | 70% ±4 | $21.63 | 3.2 | Planification, Pointe |
| gpt-5.6-terra | max | 70% ±3 | $4.95 | 14.1 | Polyvalent, Pointe |
| gpt-5.6-luna | max | 67% ±4 | $3.03 | 22.1 | Polyvalent, Sous-agent économique |
| gpt-5.5 | xhigh | 67% ±6 | $7.23 | 9.3 | Pointe, Polyvalent |
| claude-opus-4.8 | max | 59% ±2 | $13.22 | 4.5 | Pointe, Planification |
| claude-sonnet-5 | max | 54% ±4 | $26.4 | 2.0 | Planification |
| grok-4.5 | high | 54% ±2 | $2.42 | 22.3 | Polyvalent, Sous-agent économique |
| muse-spark-1.1Meilleur rapport qualité-prix | xhigh | 53% ±3 | $2.36 | 22.5 | Polyvalent, Sous-agent économique |
| gpt-5.4 | xhigh | 52% ±2 | $5.65 | 9.2 | Polyvalent |
| glm-5.2 | max | 44% ±2 | $3.92 | 11.2 | Polyvalent, Sous-agent économique |
| gemini-3.5-flash | medium | 37% ±2 | $7.34 | 5.0 | Rapide |
| kimi-k2.7-code | — | 31% ±1 | $2.82 | 11.0 | Sous-agent économique, Polyvalent |
| claude-sonnet-4.6 | high | 30% ±4 | $5.52 | 5.4 | Polyvalent |
| gemini-3.1-pro | high | 12% ±2 | $9.48 | 1.3 | Pointe |
AA Coding Agent
Instantané de l’Artificial Analysis Coding Agent Index après la disponibilité générale de GPT-5.6, le 9 juillet 2026. Consultez provenance.url. Il ne s’agit pas de mesures OpenCodex en direct.
| Modèle | Niveau | Score | Coût par tâche | Score par dollar | Cas d’usage |
|---|---|---|---|---|---|
| composer-2.5Meilleur rapport qualité-prix | std | 62 | $0.07 | 885.7 | Polyvalent, Sous-agent économique, Rapide |
| composer-2.5 | fast | 62 | $0.44 | 140.9 | Polyvalent, Rapide |
| claude-opus-4.7 | max | 66 | $4.1 | 16.1 | Pointe, Planification |
| gpt-5.5 | xhigh | 65 | $4.82 | 13.5 | Pointe, Polyvalent |
| gpt-5.6-luna | max | 75 | $1.55 | 48.4 | Polyvalent, Sous-agent économique |
| gpt-5.6-terra | max | 77 | $2.4 | 32.1 | Polyvalent |
| gpt-5.6-sol | max | 80 | $3.9 | 20.5 | Pointe, Planification |
| grok-4.5 | high | 76 | $2.54 | 29.9 | Polyvalent, Sous-agent économique |
| claude-sonnet-4.6 | high | 58 | $2.8 | 20.7 | Polyvalent |
| claude-fable-5 | high | 64 | $9.5 | 6.7 | Planification, Pointe |
FrontierCode
Instantané indicatif de cognition.com/frontiercode, FrontierCode 1.1 Main, juillet 2026. Le score suit la grille de mergeability et le coût est la moyenne en USD par exécution. Les modes de raisonnement Meilleur et Tous correspondent au sélecteur du classement Cognition. Il ne s’agit pas de mesures OpenCodex en direct.
| Modèle | Niveau | Score | Coût par tâche | Score par dollar | Cas d’usage |
|---|---|---|---|---|---|
| claude-fable-5 | xhigh | 53.5% | $13.09 | 4.1 | Pointe, Polyvalent, Planification |
| claude-fable-5 | high | 52.7% | $9.48 | 5.6 | Pointe, Polyvalent, Planification |
| claude-fable-5 | max | 51.6% | $19.07 | 2.7 | Pointe, Polyvalent, Planification |
| claude-fable-5 | medium | 49.8% | $7.15 | 7.0 | Pointe, Polyvalent, Planification |
| claude-fable-5 | low | 48% | $4.92 | 9.8 | Pointe, Polyvalent, Planification |
| gpt-5.6-sol | max | 47.5% | $6.3 | 7.5 | Pointe, Polyvalent, Planification |
| gpt-5.6-sol | xhigh | 46.8% | $5 | 9.4 | Pointe, Polyvalent, Planification |
| claude-opus-4.8 | max | 46.5% | $9.62 | 4.8 | Pointe, Polyvalent, Planification |
| claude-opus-4.8 | xhigh | 45.5% | $6.78 | 6.7 | Pointe, Polyvalent, Planification |
| gpt-5.6-sol | high | 45.1% | $4.1 | 11.0 | Pointe, Polyvalent, Planification |
| gpt-5.5 | xhigh | 43% | $4.03 | 10.7 | Pointe, Polyvalent |
| claude-sonnet-5 | xhigh | 42.7% | $9.06 | 4.7 | Pointe, Polyvalent |
| grok-4.5 | high | 42.4% | $1.3 | 32.6 | Polyvalent, Sous-agent économique, Rapide |
| claude-sonnet-5 | max | 42.4% | $15.4 | 2.8 | Pointe, Polyvalent |
| swe-1.7 | — | 42.3% | $1.97 | 21.5 | Polyvalent, Sous-agent économique |
| grok-4.5 | medium | 41.9% | $1.2 | 34.9 | Polyvalent, Sous-agent économique, Rapide |
| gpt-5.6-terra | max | 41.3% | $2.3 | 18.0 | Polyvalent |
| claude-opus-4.8 | high | 41% | $4.28 | 9.6 | Pointe, Polyvalent, Planification |
| gpt-5.5 | high | 40.6% | $3.12 | 13.0 | Pointe, Polyvalent |
| claude-opus-4.8 | medium | 40.5% | $3.7 | 10.9 | Pointe, Polyvalent, Planification |
| gpt-5.6-sol | medium | 39.9% | $3.1 | 12.9 | Pointe, Polyvalent, Planification |
| gpt-5.6-luna | max | 39.8% | $1.8 | 22.1 | Polyvalent, Sous-agent économique |
| claude-sonnet-5 | high | 39.4% | $5.49 | 7.2 | Pointe, Polyvalent |
| gpt-5.6-luna | xhigh | 38.9% | $1.5 | 25.9 | Polyvalent, Sous-agent économique |
| gpt-5.6-terra | xhigh | 38.7% | $1.6 | 24.2 | Polyvalent, Sous-agent économique |
| claude-opus-4.7 | max | 38.5% | $9.09 | 4.2 | Polyvalent |
| grok-4.5 | low | 37.9% | $0.8 | 47.4 | Polyvalent, Sous-agent économique, Rapide |
| gpt-5.6-terra | high | 36.9% | $1.4 | 26.4 | Polyvalent, Sous-agent économique, Rapide |
| gpt-5.5 | medium | 36.6% | $2.35 | 15.6 | Pointe, Polyvalent |
| gpt-5.6-luna | high | 35.9% | $1.1 | 32.6 | Polyvalent, Sous-agent économique, Rapide |
| gpt-5.6-sol | low | 35.4% | $2.1 | 16.9 | Pointe, Polyvalent, Planification |
| claude-sonnet-5 | medium | 35.2% | $3.43 | 10.3 | Pointe, Polyvalent |
| claude-opus-4.7 | high | 35.2% | $5.03 | 7.0 | Polyvalent |
| claude-opus-4.8 | low | 35.1% | $2.68 | 13.1 | Pointe, Polyvalent, Planification |
| claude-opus-4.7 | xhigh | 34.9% | $6.87 | 5.1 | Polyvalent |
| gpt-5.6-terra | medium | 33.9% | $0.9 | 37.7 | Polyvalent, Sous-agent économique, Rapide |
| gpt-5.5 | low | 30.6% | $1.65 | 18.5 | Pointe, Polyvalent, Sous-agent économique |
| kimi-k2.7 | — | 30.1% | $3.01 | 10.0 | — |
| claude-opus-4.7 | medium | 28.9% | $3.22 | 9.0 | Polyvalent |
| claude-sonnet-5 | low | 28.7% | $2.15 | 13.3 | Pointe, Polyvalent |
| claude-opus-4.7 | low | 27.6% | $2.47 | 11.2 | Polyvalent |
| gpt-5.6-luna | medium | 25.7% | $0.6 | 42.8 | Polyvalent, Sous-agent économique, Rapide |
| composer-2.5 | — | 25.6% | $3.09 | 8.3 | — |
| glm-5.2 | — | 24.5% | $2.47 | 9.9 | — |
| gpt-5.6-terra | low | 24.1% | $0.5 | 48.2 | Polyvalent, Sous-agent économique, Rapide |
| deepseek-v4-pro | — | 17.6% | $1.6 | 11.0 | Sous-agent économique |
| gpt-5.6-lunaMeilleur rapport qualité-prix | low | 15.4% | $0.2 | 77.0 | Polyvalent, Sous-agent économique, Rapide |
| minimax-m3 | — | 14.7% | $0.7 | 21.0 | Sous-agent économique, Rapide |
| inkling | 0.99 | 14% | $3.6 | 3.9 | — |
| qwen-3.7-plus | — | 10.2% | $0.2 | 51.0 | Sous-agent économique, Rapide |
FrontierSWE
Instantané indicatif de frontierswe.com selon la dominance Mean@5. L’axe horizontal utilise un tarif API public combiné en $/MTok comme indicateur de coût relatif, et non un coût par tâche mesuré. Il ne s’agit pas de mesures OpenCodex en direct.
Les coûts de ce tableau sont des estimations ou des combinaisons de tarifs API. Le classement par score/dollar et l’indication du meilleur rapport qualité-prix restent désactivés tant que chaque ligne ne dispose pas d’un coût par tâche mesuré par la source.
| Modèle | Niveau | Score | Coût par tâche | Cas d’usage |
|---|---|---|---|---|
| claude-fable-5 | claude-code | 89% | $30 | Planification, Pointe |
| grok-4.5 | grok-cli | 78% | $4 | Polyvalent, Pointe |
| claude-opus-4.8 | claude-code | 73% | $15 | Pointe, Planification |
| glm-5.2 | claude-code | 72% | $1.98 | Polyvalent, Sous-agent économique |
| gpt-5.5 | codex | 70% | $17.5 | Pointe, Polyvalent |
| claude-opus-4.7 | claude-code | 61% | $15 | Pointe |
| claude-opus-4.6 | claude-code | 53% | $15 | Polyvalent |
| gpt-5.4 | codex | 51% | $8.75 | Polyvalent |
| composer-2.5 | cursor-cli | 38% | $1 | Polyvalent, Sous-agent économique, Rapide |
| gemini-3.1-pro | gemini-cli | 37% | $8.75 | Pointe |
| glm-5.1 | claude-code | 29% | $2.9 | Polyvalent |
| deepseek-v4-pro | claude-code | 27% | $2.4 | Sous-agent économique, Polyvalent |
| kimi-k2.6 | kimi-cli | 25% | $2.13 | Sous-agent économique |
| kimi-k2.5 | kimi-cli | 25% | $2.13 | Sous-agent économique |
| qwen3.6-plus | qwen-code | 21% | $1.75 | Sous-agent économique |
Program Bench
Instantané du classement étendu de programbench.com avec mini-SWE-agent sur 200 tâches. Le score « presque résolu » correspond à au moins 95 % de tests réussis ; les coûts sont les moyennes API publiées par tâche. Il ne s’agit pas de mesures OpenCodex en direct.
| Modèle | Niveau | Score | Coût par tâche | Score par dollar | Cas d’usage |
|---|---|---|---|---|---|
| gpt-5.5Meilleur rapport qualité-prix | xhigh | 13.5% | $8.85 | 1.5 | Pointe, Planification |
| gpt-5.5 | high | 5% | $3.65 | 1.4 | Pointe, Polyvalent |
| claude-opus-4.7 | xhigh | 4.5% | $10.96 | 0.4 | Planification, Pointe |
| claude-opus-4.7 | — | 3% | $3.81 | 0.8 | Pointe |
| claude-opus-4.6 | — | 2.5% | $11.38 | 0.2 | Polyvalent |
| gpt-5.5 | — | 1.5% | $1.21 | 1.2 | Polyvalent |
| claude-sonnet-4.6 | — | 1% | $26.73 | 0.0 | Polyvalent |
| gpt-5.4 | — | 0% | $0.33 | 0.0 | Rapide, Sous-agent économique |
| gemini-3.1-pro | — | 0% | $1.51 | 0.0 | Pointe |
| gemini-3-flash | — | 0% | $0.3 | 0.0 | Rapide, Sous-agent économique |
| claude-haiku-4.5 | — | 0% | $0.8 | 0.0 | Rapide, Sous-agent économique |
| gpt-5.4-mini | — | 0% | $0.04 | 0.0 | Rapide, Sous-agent économique |
| gpt-5-mini | — | 0% | $0.03 | 0.0 | Rapide, Sous-agent économique |
SWE Marathon
Instantané indicatif de swe-marathon.org : pass@1 sur 20 tâches à très long horizon. L’axe des coûts représente un coût d’exécution relatif estimé pour de longues trajectoires, et non un coût par tâche publié. Il ne s’agit pas de mesures OpenCodex en direct.
Les coûts de ce tableau sont des estimations ou des combinaisons de tarifs API. Le classement par score/dollar et l’indication du meilleur rapport qualité-prix restent désactivés tant que chaque ligne ne dispose pas d’un coût par tâche mesuré par la source.
| Modèle | Niveau | Score | Coût par tâche | Cas d’usage |
|---|---|---|---|---|
| grok-4.5 | grok-build | 29% | $8 | Pointe, Planification |
| claude-opus-4.8 | claude-code | 26% | $28 | Pointe, Planification |
| claude-fable-5 | claude-code | 24% | $45 | Planification, Pointe |
| claude-opus-4.7 | claude-code | 16% | $22 | Pointe |
| glm-5.2 | claude-code | 13% | $6 | Polyvalent, Sous-agent économique |
| gpt-5.5 | codex | 12% | $18 | Pointe, Polyvalent |
| claude-opus-4.7 | terminus-2 | 11% | $20 | Polyvalent |
| gemini-3.5-flash | gemini-cli | 7% | $5 | Rapide |
| gpt-5.5 | terminus-2 | 6% | $16 | Polyvalent |
| gemini-3.1-pro | terminus-2 | 4% | $12 | Pointe |
| deepseek-v4-pro | terminus-2 | 4% | $7 | Sous-agent économique |
| gemini-3.1-pro | gemini-cli | 2% | $12 | Pointe |
| glm-5.1 | terminus-2 | 1% | $5 | Polyvalent |
| minimax-m2.7 | terminus-2 | 0% | $3 | Sous-agent économique |
| kimi-k2.6 | kimi-cli | 0% | $4 | Sous-agent économique |

