Index leader
GPT-5.6 Sol
67 · Codex
Lowest run cost
Muse Spark 1.1
$1.43/task
Fastest run
GPT-5.6 Luna
8.0 min/task
Model + harnessIndexDeepSWETerminal-Bench v2SWE-Atlas$ / taskTime
GPT-5.6 SolCodex · max67698843$7.0810.2m
Claude Fable 5Claude Code · max66668349$11.7123.4m
Grok 4.5Grok Build · high64608548$2.5916.5m
GPT-5.6 TerraCodex · max62678436$2.768.4m
Kimi K3Kimi Code CLI · max61648437$3.1823.8m
Claude Opus 4.8Claude Code · max61567947$7.7023.1m
GPT-5.6 LunaCodex · max59638033$1.578.0m
Muse Spark 1.1OpenCode · xhigh54547333$1.4312.6m

Equal-weight composite of DeepSWE, Terminal-Bench v2, and SWE-Atlas-QnA; every result is tied to its evaluated harness.

Looking for the full sortable table? The Leaderboard ranks every routed model with public evidence and Core judgment kept separate.