跳到內容

基準測試

這些是公開榜單的靜態快照,手動更新 — 並非 OpenCodex 的即時計量。每個榜單都 標註了來源、抓取日期和許可說明。只有當榜單中所有行都帶有來源實測的每任務成本時, 才會顯示得分/$ 排名。

按任務領域檢視:

  • 程式設計 — DeepSWE, AA Coding Agent, FrontierCode, FrontierSWE, Program Bench, SWE Marathon
  • 前端 — Frontend Code Arena
  • 終端 — Terminal Bench 2.1
  • 安全 — Cybench
  • 智慧指數 — AA Intelligence Index