AI Model Leaderboard — July 2026
Live rankings of the top AI companies and language models, updated daily. Composite scores combine benchmark performance (MMLU, HumanEval, GPQA Diamond, MATH, SWE-bench), Chatbot Arena ratings, Kalshi prediction market probabilities, and community sentiment.
Overall AI Company Rankings (July 2026)
- #1 OpenAI — Score 98.1. Latest model: GPT-5.6 (released July 9, 2026). Arena rating 1455 — the highest ever recorded. MMLU 93.1%, HumanEval 98.5%, GPQA Diamond 91.2%, MATH 94.5%, SWE-bench 87.3%.
- #2 Anthropic — Score 96.2. Latest model: Claude Fable (released June 11, 2026). Arena rating 1440. MMLU 92.4%, HumanEval 94.8%, GPQA Diamond 90.1%, SWE-bench 86.2%.
- #3 Google DeepMind — Score 93.8. Latest model: Gemini 3 Ultra (released May 14, 2026). Arena rating 1415. HumanEval 95.2%, GPQA Diamond 89.8%, MMLU 92.6%.
- #4 xAI — Score 89.5. Latest model: Grok 4.5 (released June 3, 2026). Arena rating 1400. SWE-bench 81.4%, GPQA Diamond 88.6%, HumanEval 94.3%.
- #5 Moonshot AI — Score 86.3. Latest model: Kimi K3 (released April 8, 2026). Arena rating 1385. HumanEval 93.6%, GPQA Diamond 87.1%, SWE-bench 78.5%.
- #6 Meta AI — Score 82.7. Latest model: Llama 4 Behemoth (released March 19, 2026). Arena rating 1325. Open-weights, 288B active / ~2T total MoE parameters.
Top AI Models by Arena Rating (July 2026)
- GPT-5.6 (OpenAI) — Arena #1, rating 1455. Released July 9, 2026. Composite score 99.1.
- Claude Fable (Anthropic) — Arena #2, rating 1440. Released June 11, 2026. Composite score 97.8.
- GPT-5.5 (OpenAI) — Arena #3, rating 1420. Released April 23, 2026. Composite score 97.2.
- Gemini 3 Ultra (Google DeepMind) — Arena #4, rating 1415. Released May 14, 2026. Composite score 95.1.
- Grok 4.5 (xAI) — Arena #5, rating 1400. Released June 3, 2026. Composite score 92.1.
- Claude Opus 4.5 (Anthropic) — Arena #6, rating 1395. Released September 15, 2025. Composite score 95.3.
- Gemini 3 Pro (Google DeepMind) — Arena #7, rating 1390. Released January 22, 2026. Composite score 92.4.
- Kimi K3 (Moonshot AI) — Arena #8, rating 1385. Released April 8, 2026. Composite score 90.8.
- GPT-5 (OpenAI) — Arena #9, rating 1380. Released August 7, 2025. Composite score 93.8.
- Claude Sonnet 4.5 (Anthropic) — Arena #10, rating 1372. Released June 20, 2025. Composite score 92.1.
Benchmark Leaderboard
SWE-bench (Software Engineering)
- GPT-5.6 — 87.3%
- Claude Fable — 86.2%
- GPT-5.5 — 84.6%
- Grok 4.5 — 81.4%
- Claude Opus 4.5 — 80.9%
- Gemini 3 Ultra — 82.1%
- Kimi K3 — 78.5%
HumanEval (Coding)
- GPT-5.6 — 98.5%
- GPT-5.5 — 97.4%
- Gemini 3 Ultra — 95.2%
- Grok 4.5 — 94.3%
- Claude Fable — 94.8%
- Kimi K3 — 93.6%
GPQA Diamond (Science reasoning)
- GPT-5.6 — 91.2%
- Claude Fable — 90.1%
- Gemini 3 Ultra — 89.8%
- Grok 4.5 — 88.6%
- GPT-5.5 — 89.3%
- Kimi K3 — 87.1%
Prediction Markets (Kalshi, July 2026)
- Will Anthropic IPO before OpenAI? — 85% probability (Kalshi)
- Will any company announce AGI before January 2029? — 72% probability (Kalshi)
- Will xAI release Grok 5 before end of 2026? — 67% probability
- Will Google release Gemini 4 before end of 2026? — 62% probability
- Will the U.S. government take control of any AI company before 2030? — 37% probability (Kalshi)
- Will OpenAI IPO before Anthropic? — 20% probability (Kalshi)
- Will any company announce AGI before January 2027? — 13% probability (Kalshi)
- Will any company announce AGI before October 2026? — 7% probability (Kalshi)
Last updated: July 20, 2026. Data sources: LMSYS Chatbot Arena, Kalshi prediction markets, community sentiment analysis.