Compare Models

Side-by-side performance comparison across all benchmark categories.

Select Models to Compare

Category Radar Comparison

The radar visualization is shown on wider screens. On mobile, use the detailed comparison cards below for exact per-category, composite, and token-efficiency values without clipped labels.

Performance Over Time

Detailed Score Comparison

Composite

Claude Opus 5

85.4

Claude Sonnet 5

88.1

GPT-5.6 Sol

82.9

Grok 4.5

76.0

Token Benchmark

Claude Opus 5

66.7

Claude Sonnet 5

100.0

GPT-5.6 Sol

45.4

Grok 4.5

10.7

Avg Tokens/Test

Claude Opus 5

13.4k

Claude Sonnet 5

8.9k

GPT-5.6 Sol

19.6k

Grok 4.5

83.1k

Total Tokens

Claude Opus 5

400.6k

Claude Sonnet 5

267.2k

GPT-5.6 Sol

588.4k

Grok 4.5

2.5M

Token EfficiencyCategory

Claude Opus 5

66.7

Claude Sonnet 5

100.0BEST

GPT-5.6 Sol

45.4

Grok 4.5

10.7

Long ReasoningCategory

Claude Opus 5

46.2

Claude Sonnet 5

51.6BEST

GPT-5.6 Sol

39.8

Grok 4.5

46.4

Coding TasksCategory

Claude Opus 5

93.0

Claude Sonnet 5

94.7

GPT-5.6 Sol

92.7

Grok 4.5

96.0BEST

Bug FixesCategory

Claude Opus 5

98.4BEST

Claude Sonnet 5

95.7

GPT-5.6 Sol

88.0

Grok 4.5

92.7

Feature ImplementationCategory

Claude Opus 5

94.3

Claude Sonnet 5

96.7BEST

GPT-5.6 Sol

94.0

Grok 4.5

82.7

Code ThoroughnessCategory

Claude Opus 5

84.5

Claude Sonnet 5

86.2

GPT-5.6 Sol

90.9BEST

Grok 4.5

77.6

Bug Introduction RateCategory

Claude Opus 5

95.3

Claude Sonnet 5

90.7

GPT-5.6 Sol

91.0

Grok 4.5

96.3BEST

Security AwarenessCategory

Claude Opus 5

85.5

Claude Sonnet 5

89.3BEST

GPT-5.6 Sol

86.3

Grok 4.5

86.9

Instruction FollowingCategory

Claude Opus 5

94.7

Claude Sonnet 5

82.7

GPT-5.6 Sol

100.0BEST

Grok 4.5

83.3

Code QualityCategory

Claude Opus 5

87.7

Claude Sonnet 5

89.7

GPT-5.6 Sol

92.0BEST

Grok 4.5

73.7

Performance & EfficiencyCategory

Claude Opus 5

92.7BEST

Claude Sonnet 5

92.3

GPT-5.6 Sol

92.0

Grok 4.5

90.0