AI Model Leaderboard — July 2026

Live rankings of the top AI companies and language models, updated daily. Composite scores combine benchmark performance (MMLU, HumanEval, GPQA Diamond, MATH, SWE-bench), Chatbot Arena ratings, Kalshi prediction market probabilities, and community sentiment.

Overall AI Company Rankings (July 2026)

  1. #1 OpenAI — Score 98.1. Latest model: GPT-5.6 (released July 9, 2026). Arena rating 1455 — the highest ever recorded. MMLU 93.1%, HumanEval 98.5%, GPQA Diamond 91.2%, MATH 94.5%, SWE-bench 87.3%.
  2. #2 Anthropic — Score 96.2. Latest model: Claude Fable (released June 11, 2026). Arena rating 1440. MMLU 92.4%, HumanEval 94.8%, GPQA Diamond 90.1%, SWE-bench 86.2%.
  3. #3 Google DeepMind — Score 93.8. Latest model: Gemini 3 Ultra (released May 14, 2026). Arena rating 1415. HumanEval 95.2%, GPQA Diamond 89.8%, MMLU 92.6%.
  4. #4 xAI — Score 89.5. Latest model: Grok 4.5 (released June 3, 2026). Arena rating 1400. SWE-bench 81.4%, GPQA Diamond 88.6%, HumanEval 94.3%.
  5. #5 Moonshot AI — Score 86.3. Latest model: Kimi K3 (released April 8, 2026). Arena rating 1385. HumanEval 93.6%, GPQA Diamond 87.1%, SWE-bench 78.5%.
  6. #6 Meta AI — Score 82.7. Latest model: Llama 4 Behemoth (released March 19, 2026). Arena rating 1325. Open-weights, 288B active / ~2T total MoE parameters.

Top AI Models by Arena Rating (July 2026)

  1. GPT-5.6 (OpenAI) — Arena #1, rating 1455. Released July 9, 2026. Composite score 99.1.
  2. Claude Fable (Anthropic) — Arena #2, rating 1440. Released June 11, 2026. Composite score 97.8.
  3. GPT-5.5 (OpenAI) — Arena #3, rating 1420. Released April 23, 2026. Composite score 97.2.
  4. Gemini 3 Ultra (Google DeepMind) — Arena #4, rating 1415. Released May 14, 2026. Composite score 95.1.
  5. Grok 4.5 (xAI) — Arena #5, rating 1400. Released June 3, 2026. Composite score 92.1.
  6. Claude Opus 4.5 (Anthropic) — Arena #6, rating 1395. Released September 15, 2025. Composite score 95.3.
  7. Gemini 3 Pro (Google DeepMind) — Arena #7, rating 1390. Released January 22, 2026. Composite score 92.4.
  8. Kimi K3 (Moonshot AI) — Arena #8, rating 1385. Released April 8, 2026. Composite score 90.8.
  9. GPT-5 (OpenAI) — Arena #9, rating 1380. Released August 7, 2025. Composite score 93.8.
  10. Claude Sonnet 4.5 (Anthropic) — Arena #10, rating 1372. Released June 20, 2025. Composite score 92.1.

Benchmark Leaderboard

SWE-bench (Software Engineering)

  1. GPT-5.6 — 87.3%
  2. Claude Fable — 86.2%
  3. GPT-5.5 — 84.6%
  4. Grok 4.5 — 81.4%
  5. Claude Opus 4.5 — 80.9%
  6. Gemini 3 Ultra — 82.1%
  7. Kimi K3 — 78.5%

HumanEval (Coding)

  1. GPT-5.6 — 98.5%
  2. GPT-5.5 — 97.4%
  3. Gemini 3 Ultra — 95.2%
  4. Grok 4.5 — 94.3%
  5. Claude Fable — 94.8%
  6. Kimi K3 — 93.6%

GPQA Diamond (Science reasoning)

  1. GPT-5.6 — 91.2%
  2. Claude Fable — 90.1%
  3. Gemini 3 Ultra — 89.8%
  4. Grok 4.5 — 88.6%
  5. GPT-5.5 — 89.3%
  6. Kimi K3 — 87.1%

Prediction Markets (Kalshi, July 2026)

Last updated: July 20, 2026. Data sources: LMSYS Chatbot Arena, Kalshi prediction markets, community sentiment analysis.