Top Performing Model
Based on composite benchmark scores
Claude Sonnet 5
Leading today's benchmarks
Performance Timeline
Active Regressions
34Instruction Following dropped -13.2% from 95.3 to 82.7
Detected Aug 12, 2026 · 7-day window
Performance Efficiency dropped -9.2% from 89.2 to 81.0
Detected Aug 9, 2026 · 7-day window
Code Quality dropped -7.9% from 89.8 to 82.7
Detected Aug 8, 2026 · 7-day window
Bug Introduction Rate dropped -27.9% from 93.3 to 67.3
Detected Aug 8, 2026 · 7-day window
Code Quality dropped -3.9% from 89.1 to 85.7
Detected Aug 6, 2026 · 7-day window
Instruction Following dropped -4.0% from 92.4 to 88.7
Detected Aug 6, 2026 · 7-day window
Code Thoroughness dropped -4.7% from 90.2 to 85.9
Detected Aug 6, 2026 · 7-day window
Code Quality dropped -5.1% from 89.6 to 85.0
Detected Aug 6, 2026 · 7-day window
Overall dropped -6.8% from 85.6 to 79.8
Detected Aug 5, 2026 · 7-day window
Coding Tasks dropped -3.3% from 93.8 to 90.7
Detected Aug 5, 2026 · 7-day window
Bug Fixes dropped -5.5% from 92.8 to 87.7
Detected Aug 5, 2026 · 7-day window
Bug Fixes dropped -13.3% from 93.8 to 81.3
Detected Aug 5, 2026 · 7-day window
Security Awareness dropped -5.7% from 87.3 to 82.4
Detected Aug 4, 2026 · 7-day window
Token Efficiency dropped -7.8% from 44.0 to 40.6
Detected Aug 3, 2026 · 7-day window
Long Reasoning dropped -14.1% from 42.5 to 36.5
Detected Aug 3, 2026 · 7-day window
Bug Introduction Rate dropped -22.0% from 94.5 to 73.7
Detected Aug 3, 2026 · 7-day window
Feature Implementation dropped -23.8% from 83.6 to 63.7
Detected Aug 1, 2026 · 7-day window
Coding Tasks dropped -10.1% from 85.6 to 77.0
Detected Aug 1, 2026 · 7-day window
Bug Introduction Rate dropped -35.3% from 91.1 to 59.0
Detected Jul 31, 2026 · 7-day window
Performance Efficiency dropped -28.7% from 91.2 to 65.0
Detected Jul 31, 2026 · 7-day window
Performance Efficiency dropped -10.7% from 93.0 to 83.0
Detected Jul 31, 2026 · 7-day window
Overall dropped -8.7% from 74.1 to 67.7
Detected Jul 30, 2026 · 7-day window
Token Efficiency dropped -14.7% from 70.7 to 60.3
Detected Jul 30, 2026 · 7-day window
Bug Introduction Rate dropped -25.8% from 90.8 to 67.3
Detected Jul 30, 2026 · 7-day window
Coding Tasks dropped -3.5% from 90.5 to 87.3
Detected Jul 29, 2026 · 7-day window
Instruction Following dropped -8.8% from 92.9 to 84.7
Detected Jul 28, 2026 · 7-day window
Code Quality dropped -8.6% from 79.6 to 72.7
Detected Jul 28, 2026 · 7-day window
Security Awareness dropped -5.7% from 84.0 to 79.2
Detected Jul 28, 2026 · 7-day window
Long Reasoning dropped -28.8% from 64.3 to 45.8
Detected Jul 28, 2026 · 7-day window
Long Reasoning dropped -31.8% from 62.7 to 42.8
Detected Jul 28, 2026 · 7-day window
Code Thoroughness dropped -3.8% from 92.9 to 89.4
Detected Jun 28, 2026 · 7-day window
Long Reasoning dropped -5.4% from 73.8 to 69.8
Detected Jun 21, 2026 · 7-day window
Security Awareness dropped -3.3% from 93.3 to 90.2
Detected Jun 15, 2026 · 7-day window
Token Efficiency dropped -78.5% from 61.5 to 13.2
Detected Jun 6, 2026 · 7-day window
Category Performance Heatmap
Latest Benchmark Run
Composite benchmark summary
Composite
85.4
Token Benchmark
66.7
400.6k
~13.4k/test
Composite benchmark summary
Composite
88.1
Token Benchmark
100.0
267.2k
~8.9k/test
Composite benchmark summary
Composite
82.9
Token Benchmark
45.4
588.4k
~19.6k/test
Composite benchmark summary
Composite
76.0
Token Benchmark
10.7
2.5M
~83.1k/test
| Model | Composite | Rank | Best Category | Worst Category | Tokens | Details |
|---|---|---|---|---|---|---|
Claude Opus 5 | 85.4 | #2 | 98.4Bug Fixes | 46.2Long Reasoning | 400.6k | View |
Claude Sonnet 5 | 88.1 | #1 | 100.0Token Efficiency | 51.6Long Reasoning | 267.2k | View |
GPT-5.6 Sol | 82.9 | #3 | 100.0Instruction Following | 39.8Long Reasoning | 588.4k | View |
Grok 4.5 | 76.0 | #4 | 96.3Bug Introduction Rate | 10.7Token Efficiency | 2.5M | View |