Top Performing Model

Based on composite benchmark scores

anthropic

Claude Sonnet 5

Leading today's benchmarks

0.0/100
+0.4%vs prev day

Performance Timeline

Active Regressions

34
Claude Sonnet 5moderate

Instruction Following dropped -13.2% from 95.3 to 82.7

Detected Aug 12, 2026 · 7-day window

Grok 4.5moderate

Performance Efficiency dropped -9.2% from 89.2 to 81.0

Detected Aug 9, 2026 · 7-day window

Claude Sonnet 5moderate

Code Quality dropped -7.9% from 89.8 to 82.7

Detected Aug 8, 2026 · 7-day window

Claude Sonnet 5major

Bug Introduction Rate dropped -27.9% from 93.3 to 67.3

Detected Aug 8, 2026 · 7-day window

GPT-5.6 Solminor

Code Quality dropped -3.9% from 89.1 to 85.7

Detected Aug 6, 2026 · 7-day window

Claude Opus 5minor

Instruction Following dropped -4.0% from 92.4 to 88.7

Detected Aug 6, 2026 · 7-day window

Claude Opus 5minor

Code Thoroughness dropped -4.7% from 90.2 to 85.9

Detected Aug 6, 2026 · 7-day window

Claude Opus 5moderate

Code Quality dropped -5.1% from 89.6 to 85.0

Detected Aug 6, 2026 · 7-day window

Claude Opus 5moderate

Overall dropped -6.8% from 85.6 to 79.8

Detected Aug 5, 2026 · 7-day window

GPT-5.6 Solminor

Coding Tasks dropped -3.3% from 93.8 to 90.7

Detected Aug 5, 2026 · 7-day window

Claude Sonnet 5moderate

Bug Fixes dropped -5.5% from 92.8 to 87.7

Detected Aug 5, 2026 · 7-day window

Claude Opus 5moderate

Bug Fixes dropped -13.3% from 93.8 to 81.3

Detected Aug 5, 2026 · 7-day window

Claude Opus 5moderate

Security Awareness dropped -5.7% from 87.3 to 82.4

Detected Aug 4, 2026 · 7-day window

GPT-5.6 Solmoderate

Token Efficiency dropped -7.8% from 44.0 to 40.6

Detected Aug 3, 2026 · 7-day window

GPT-5.6 Solmoderate

Long Reasoning dropped -14.1% from 42.5 to 36.5

Detected Aug 3, 2026 · 7-day window

Claude Opus 5major

Bug Introduction Rate dropped -22.0% from 94.5 to 73.7

Detected Aug 3, 2026 · 7-day window

Grok 4.5major

Feature Implementation dropped -23.8% from 83.6 to 63.7

Detected Aug 1, 2026 · 7-day window

Grok 4.5moderate

Coding Tasks dropped -10.1% from 85.6 to 77.0

Detected Aug 1, 2026 · 7-day window

GPT-5.6 Solmajor

Bug Introduction Rate dropped -35.3% from 91.1 to 59.0

Detected Jul 31, 2026 · 7-day window

Claude Sonnet 5major

Performance Efficiency dropped -28.7% from 91.2 to 65.0

Detected Jul 31, 2026 · 7-day window

Claude Opus 5moderate

Performance Efficiency dropped -10.7% from 93.0 to 83.0

Detected Jul 31, 2026 · 7-day window

Grok 4.5moderate

Overall dropped -8.7% from 74.1 to 67.7

Detected Jul 30, 2026 · 7-day window

Claude Opus 5moderate

Token Efficiency dropped -14.7% from 70.7 to 60.3

Detected Jul 30, 2026 · 7-day window

Grok 4.5major

Bug Introduction Rate dropped -25.8% from 90.8 to 67.3

Detected Jul 30, 2026 · 7-day window

Claude Sonnet 5minor

Coding Tasks dropped -3.5% from 90.5 to 87.3

Detected Jul 29, 2026 · 7-day window

Grok 4.5moderate

Instruction Following dropped -8.8% from 92.9 to 84.7

Detected Jul 28, 2026 · 7-day window

Grok 4.5moderate

Code Quality dropped -8.6% from 79.6 to 72.7

Detected Jul 28, 2026 · 7-day window

GPT-5.6 Solmoderate

Security Awareness dropped -5.7% from 84.0 to 79.2

Detected Jul 28, 2026 · 7-day window

Claude Sonnet 5major

Long Reasoning dropped -28.8% from 64.3 to 45.8

Detected Jul 28, 2026 · 7-day window

Claude Opus 5major

Long Reasoning dropped -31.8% from 62.7 to 42.8

Detected Jul 28, 2026 · 7-day window

Grok 4.5minor

Code Thoroughness dropped -3.8% from 92.9 to 89.4

Detected Jun 28, 2026 · 7-day window

Grok 4.5moderate

Long Reasoning dropped -5.4% from 73.8 to 69.8

Detected Jun 21, 2026 · 7-day window

Grok 4.5minor

Security Awareness dropped -3.3% from 93.3 to 90.2

Detected Jun 15, 2026 · 7-day window

Grok 4.5major

Token Efficiency dropped -78.5% from 61.5 to 13.2

Detected Jun 6, 2026 · 7-day window

Latest Benchmark Run

Aug 12, 4:16 AMdaily
Claude Opus 5

Composite benchmark summary

#2

Composite

85.4

Token Benchmark

66.7

Total tokens

400.6k

~13.4k/test

Best category98.4 Bug Fixes
Worst category46.2 Long Reasoning
View details
Claude Sonnet 5

Composite benchmark summary

#1

Composite

88.1

Token Benchmark

100.0

Total tokens

267.2k

~8.9k/test

Best category100.0 Token Efficiency
Worst category51.6 Long Reasoning
View details
GPT-5.6 Sol

Composite benchmark summary

#3

Composite

82.9

Token Benchmark

45.4

Total tokens

588.4k

~19.6k/test

Best category100.0 Instruction Following
Worst category39.8 Long Reasoning
View details
Grok 4.5

Composite benchmark summary

#4

Composite

76.0

Token Benchmark

10.7

Total tokens

2.5M

~83.1k/test

Best category96.3 Bug Introduction Rate
Worst category10.7 Token Efficiency
View details