Compare Models
Side-by-side performance comparison across all benchmark categories.
Select Models to Compare
Category Radar Comparison
The radar visualization is shown on wider screens. On mobile, use the detailed comparison cards below for exact per-category, composite, and token-efficiency values without clipped labels.
Performance Over Time
Detailed Score Comparison
Composite
Claude Opus 5
85.4
Claude Sonnet 5
88.1
GPT-5.6 Sol
82.9
Grok 4.5
76.0
Token Benchmark
Claude Opus 5
66.7
Claude Sonnet 5
100.0
GPT-5.6 Sol
45.4
Grok 4.5
10.7
Avg Tokens/Test
Claude Opus 5
13.4k
Claude Sonnet 5
8.9k
GPT-5.6 Sol
19.6k
Grok 4.5
83.1k
Total Tokens
Claude Opus 5
400.6k
Claude Sonnet 5
267.2k
GPT-5.6 Sol
588.4k
Grok 4.5
2.5M
Claude Opus 5
66.7
Claude Sonnet 5
100.0BEST
GPT-5.6 Sol
45.4
Grok 4.5
10.7
Claude Opus 5
46.2
Claude Sonnet 5
51.6BEST
GPT-5.6 Sol
39.8
Grok 4.5
46.4
Claude Opus 5
93.0
Claude Sonnet 5
94.7
GPT-5.6 Sol
92.7
Grok 4.5
96.0BEST
Claude Opus 5
98.4BEST
Claude Sonnet 5
95.7
GPT-5.6 Sol
88.0
Grok 4.5
92.7
Claude Opus 5
94.3
Claude Sonnet 5
96.7BEST
GPT-5.6 Sol
94.0
Grok 4.5
82.7
Claude Opus 5
84.5
Claude Sonnet 5
86.2
GPT-5.6 Sol
90.9BEST
Grok 4.5
77.6
Claude Opus 5
95.3
Claude Sonnet 5
90.7
GPT-5.6 Sol
91.0
Grok 4.5
96.3BEST
Claude Opus 5
85.5
Claude Sonnet 5
89.3BEST
GPT-5.6 Sol
86.3
Grok 4.5
86.9
Claude Opus 5
94.7
Claude Sonnet 5
82.7
GPT-5.6 Sol
100.0BEST
Grok 4.5
83.3
Claude Opus 5
87.7
Claude Sonnet 5
89.7
GPT-5.6 Sol
92.0BEST
Grok 4.5
73.7
Claude Opus 5
92.7BEST
Claude Sonnet 5
92.3
GPT-5.6 Sol
92.0
Grok 4.5
90.0
| Category | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | Grok 4.5 |
|---|---|---|---|---|
| Token Efficiency | 66.7 | 100.0 | 45.4 | 10.7 |
| Long Reasoning | 46.2 | 51.6 | 39.8 | 46.4 |
| Coding Tasks | 93.0 | 94.7 | 92.7 | 96.0 |
| Bug Fixes | 98.4 | 95.7 | 88.0 | 92.7 |
| Feature Implementation | 94.3 | 96.7 | 94.0 | 82.7 |
| Code Thoroughness | 84.5 | 86.2 | 90.9 | 77.6 |
| Bug Introduction Rate | 95.3 | 90.7 | 91.0 | 96.3 |
| Security Awareness | 85.5 | 89.3 | 86.3 | 86.9 |
| Instruction Following | 94.7 | 82.7 | 100.0 | 83.3 |
| Code Quality | 87.7 | 89.7 | 92.0 | 73.7 |
| Performance & Efficiency | 92.7 | 92.3 | 92.0 | 90.0 |
| Composite | 85.4 | 88.1 | 82.9 | 76.0 |
| Total Tokens | 400.6k | 267.2k | 588.4k | 2.5M |
| Avg Tokens / Test | 13.4k | 8.9k | 19.6k | 83.1k |
| Token Benchmark | 66.7 | 100.0 | 45.4 | 10.7 |