AA Coding Index
Artificial Analysis composite coding score: equally-weighted average of SciCode, Terminal-Bench Hard, and LiveCodeBench. Higher = better.
Top 25 models
| Rank | Model | Score | Captured |
|---|---|---|---|
| 1 | GPT-5 | 78.3% | 2026-07-31 |
| 2 | Claude Opus 4 | 74.3% | 2026-07-31 |
| 3 | Claude Opus 4.7 | 73.6% | 2026-07-31 |
| 4 | Grok 4 | 72.4% | 2026-07-31 |
| 5 | GPT-5.4 | 71.1% | 2026-07-31 |
| 6 | Gemini 3.1 Pro | 68.8% | 2026-07-31 |
| 7 | GLM-5 | 68.8% | 2026-07-31 |
| 8 | Claude Sonnet 4.6 | 63.0% | 2026-07-31 |
| 9 | Kimi K2 | 61.8% | 2026-07-31 |
| 10 | MiniMax M2 | 52.6% | 2026-07-31 |
| 11 | Claude Sonnet 4.5 | 52.1% | 2026-07-31 |
| 12 | GPT-5.1 | 49.4% | 2026-07-31 |
| 13 | Gemini 2.5 Pro | 46.7% | 2026-07-31 |
| 14 | GLM-4.6 | 45.8% | 2026-07-31 |
| 15 | GLM-4.7 | 45.3% | 2026-07-31 |
| 16 | DeepSeek V3 | 44.2% | 2026-07-31 |
| 17 | Claude Haiku 4.5 | 43.9% | 2026-07-31 |
| 18 | DeepSeek V3.1 | 43.5% | 2026-07-31 |
| 19 | o1 | 39.7% | 2026-07-31 |
| 20 | Claude Sonnet 4 | 37.6% | 2026-07-31 |
| 21 | Claude 3.7 Sonnet | 36.4% | 2026-07-31 |
| 22 | Qwen 3 Coder | 36.2% | 2026-07-31 |
| 23 | Gemini 3.1 Flash | 34.7% | 2026-07-31 |
| 24 | o1-preview | 34.0% | 2026-07-31 |
| 25 | Claude 3.5 Sonnet | 30.2% | 2026-07-31 |
Upstream leaderboard: https://artificialanalysis.ai/models/capabilities/coding