Coding Agent Leaderboard
Performance, efficiency, coverage, and reliability across coding-agent benchmarks. Each result is one model + harness run on one benchmark.
Cross-benchmark ordering uses within-benchmark percentiles rather than averaging incompatible raw score scales. Missing metrics remain missing and reduce coverage; they are never converted to zero.
Rankings
Paired comparisons are shown first, followed by benchmark-specific metric rankings.
Paired Comparisons
Rankings computed from head-to-head benchmark results using a Bradley–Terry paired-comparison model. Handles missing data and inconsistent orderings.
Harness ranking
1 | Claude Code | 0.445 | 0.458 | 0.571 | 0.303 |
Model ranking
10 | Mistral-Small-4-119B-2603-NVFP4 | 0.633 | 0.604 | 0.851 | 0.332 |
1 | Opus 4.8 | 0.74 | 0.851 | ||
2 | Opus 4.6 | 0.633 | |||
3 | GPT 5.5 - high | 0.604 | 0.798 | ||
4 | Sonnet 4.6 | 0.557 | 0.5 | 0.796 | |
5 | Qwen3.6-27B-FP8 | 0.467 | 0.528 | 0.677 | |
6 | Qwen3.6-35B-A3B-NVFP4 | 0.431 | 0.611 | 0.332 | |
7 | Gemma4-31B-FP8 | 0.434 | 0.597 | ||
8 | Nemotron-3-Super-120B-NVFP4 | 0.249 | 0.377 | 0.46 | |
9 | GPT-OSS-120B | 0.28 | 0.333 | 0.312 | |
10 | Mistral-Small-4-119B-2603-NVFP4 | 0.326 | 0.223 |
Model + harness ranking
10 | Mistral-Small-4-119B-2603-NVFP4 + Claude Code | 0.633 | 0.781 | 0.834 | 0.303 |
1 | Opus 4.8 + OpenCode | 0.781 | 0.834 | ||
2 | Opus 4.8 + Claude Code | 0.698 | 0.868 | ||
3 | Opus 4.6 + Claude Code | 0.633 | |||
4 | Sonnet 4.6 + Claude Code | 0.557 | 0.5 | 0.796 | |
5 | Qwen3.6-27B-FP8 + Claude Code | 0.493 | 0.521 | 0.694 | |
6 | Qwen3.6-27B-FP8 + Pi | 0.468 | 0.49 | 0.694 | |
7 | Qwen3.6-27B-FP8 + OpenCode | 0.44 | 0.573 | 0.642 | |
8 | Qwen3.6-35B-A3B-NVFP4 + Pi | 0.479 | 0.65 | 0.36 | |
9 | Qwen3.6-35B-A3B-NVFP4 + Claude Code | 0.458 | 0.632 | ||
10 | Gemma4-31B-FP8 + Pi | 0.469 | 0.574 | ||
11 | Gemma4-31B-FP8 + Claude Code | 0.417 | 0.612 | ||
12 | Gemma4-31B-FP8 + OpenCode | 0.417 | 0.606 | ||
13 | Qwen3.6-35B-A3B-NVFP4 + OpenClaw | 0.406 | 0.588 | ||
14 | Nemotron-3-Super-120B-NVFP4 + Claude Code | 0.224 | 0.432 | 0.472 | |
15 | Qwen3.6-35B-A3B-NVFP4 + OpenCode | 0.375 | 0.548 | 0.303 | |
16 | GPT-OSS-120B + Claude Code | 0.317 | 0.375 | 0.376 | |
17 | Mistral-Small-4-119B-2603-NVFP4 + OpenCode | 0.385 | 0.318 | ||
18 | Nemotron-3-Super-120B-NVFP4 + Pi | 0.216 | 0.375 | 0.498 | |
19 | Nemotron-3-Super-120B-NVFP4 + OpenCode | 0.308 | 0.323 | 0.41 | |
20 | GPT-OSS-120B + OpenCode | 0.294 | 0.333 | 0.326 | |
21 | GPT-OSS-120B + Pi | 0.23 | 0.292 | 0.234 | |
22 | Mistral-Small-4-119B-2603-NVFP4 + Pi | 0.333 | 0.232 | ||
23 | Mistral-Small-4-119B-2603-NVFP4 + Claude Code | 0.26 | 0.118 |
Metric rankings
Use the shared display controls below, then choose a benchmark for each metric. Tables are capped to a scrollable height so the visualizations stay primary.
Score
Score (%). Higher is better.
Token usage
Total tokens per task. Lower is better.
Cost
Cost per task (USD). Lower is better.
Response time
Total time per task (seconds). Lower is better.
Reliability
Execution error rate (%). Lower is better.
Tokens per successful task
Tokens per successful task. Lower is better.
Cost per successful task
Cost per successful task (USD). Lower is better.
Time per successful task
Time per successful task (seconds). Lower is better.
Ranking data
One table for the page, placed after all charts. It includes the score, resource, timing, reliability, and per-success values for the selected benchmark.
RedHatAI/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 | Claude Code | SWE-Bench Verified | 86.8 | 10 | 95.65 | 1591190 | 0.79 | null | null | null | 1833168 | 0.91 | null |
Opus 4.8 | Claude Code | SWE-Bench Verified | 86.8 | 1 | 100 | 1591190 | 0.79 | 319 | 208 | 0 | 1833168 | 0.91 | 368 |
Opus 4.8 | OpenCode | SWE-Bench Verified | 83.4 | 2 | 95.65 | 1398234 | 0.64 | 343 | 229 | 0 | 1676540 | 0.77 | 411 |
GPT 5.5 - high | Codex | SWE-Bench Verified | 79.8 | 3 | 91.3 | 1611158 | 0.89 | 283 | 185 | 0 | 2018995 | 1.12 | 355 |
Sonnet 4.6 | Claude Code | SWE-Bench Verified | 79.6 | 4 | 86.96 | null | null | null | null | null | null | null | null |
RedHatAI/Qwen3.6-27B-FP8 | Claude Code | SWE-Bench Verified | 69.4 | 5 | 80.43 | 2024199 | 0.17 | 822 | 457 | 0.6 | 2916713 | 0.24 | 1184 |
RedHatAI/Qwen3.6-27B-FP8 | Pi | SWE-Bench Verified | 69.4 | 5 | 80.43 | 1098072 | 0.1 | 817 | 261 | 1.4 | 1582236 | 0.14 | 1177 |
RedHatAI/Qwen3.6-35B-A3B-NVFP4 | Pi | SWE-Bench Verified | 65 | 7 | 73.91 | 1595035 | 0.08 | 437 | 309 | 1.2 | 2453900 | 0.12 | 672 |
RedHatAI/Qwen3.6-27B-FP8 | OpenCode | SWE-Bench Verified | 64.2 | 8 | 69.57 | 797177 | 0.07 | 749 | 185 | 1.6 | 1241709 | 0.11 | 1167 |
RedHatAI/Qwen3.6-35B-A3B-NVFP4 | Qwen Code | SWE-Bench Verified | 63.8 | 9 | 65.22 | 1227106 | 0.07 | 357 | 264 | 0.6 | 1923364 | 0.11 | 560 |
RedHatAI/Qwen3.6-35B-A3B-NVFP4 | Claude Code | SWE-Bench Verified | 63.2 | 10 | 60.87 | 2224704 | 0.07 | 343 | 245 | 0.2 | 3520101 | 0.11 | 543 |
RedHatAI/gemma-4-31B-it-FP8-block | Claude Code | SWE-Bench Verified | 61.2 | 11 | 56.52 | 1311796 | 0.21 | 1338 | 1049 | 7 | 2143458 | 0.34 | 2186 |
RedHatAI/gemma-4-31B-it-FP8-block | OpenCode | SWE-Bench Verified | 60.6 | 12 | 52.17 | 1059493 | 0.11 | 889 | 332 | 2.4 | 1748338 | 0.18 | 1467 |
RedHatAI/Qwen3.6-35B-A3B-NVFP4 | OpenClaw | SWE-Bench Verified | 58.8 | 13 | 47.83 | null | 0.07 | 400 | 240 | 0.6 | null | 0.12 | 680 |
RedHatAI/gemma-4-31B-it-FP8-block | Pi | SWE-Bench Verified | 57.4 | 14 | 43.48 | 763314 | 0.08 | 770 | 244 | 0 | 1329815 | 0.14 | 1341 |
RedHatAI/Qwen3.6-35B-A3B-NVFP4 | OpenCode | SWE-Bench Verified | 54.8 | 15 | 39.13 | 949488 | 0.06 | 370 | 240 | 0.8 | 1732642 | 0.11 | 675 |
RedHatAI/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 | Pi | SWE-Bench Verified | 49.8 | 16 | 34.78 | 2008071 | 0.07 | 893 | 288 | 1.2 | 4032271 | 0.14 | 1793 |
RedHatAI/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 | Claude Code | SWE-Bench Verified | 47.2 | 17 | 30.43 | 1778039 | 0.09 | 821 | 348 | 0 | 3767032 | 0.19 | 1739 |
RedHatAI/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 | OpenCode | SWE-Bench Verified | 41 | 18 | 26.09 | 1461850 | 0.04 | 1037 | 186 | 0.2 | 3565488 | 0.1 | 2529 |
RedHatAI/gpt-oss-120b | Claude Code | SWE-Bench Verified | 37.6 | 19 | 21.74 | 1678615 | 0.01 | 401 | 301 | 2.6 | 4464402 | 0.03 | 1066 |
RedHatAI/gpt-oss-120b | OpenCode | SWE-Bench Verified | 32.6 | 20 | 17.39 | 408602 | 0.01 | 644 | 70 | 6.6 | 1253380 | 0.03 | 1975 |
RedHatAI/Mistral-Small-4-119B-2603-NVFP4 | OpenCode | SWE-Bench Verified | 31.8 | 21 | 13.04 | 755531 | 0.03 | 1086 | 98 | 1.2 | 2375884 | 0.09 | 3415 |
RedHatAI/gpt-oss-120b | Pi | SWE-Bench Verified | 23.4 | 22 | 8.7 | 182024 | 0.03 | 352 | 293 | 9.4 | 777880 | 0.13 | 1504 |
RedHatAI/Mistral-Small-4-119B-2603-NVFP4 | Pi | SWE-Bench Verified | 23.2 | 23 | 4.35 | 395947 | 0.02 | 917 | 58 | 2.4 | 1706668 | 0.09 | 3953 |
RedHatAI/Mistral-Small-4-119B-2603-NVFP4 | Claude Code | SWE-Bench Verified | 11.8 | 24 | 0 | 624547 | 0.02 | 1111 | 108 | 10.6 | 5292771 | 0.17 | 9415 |