US vs China AI race
For each public test: the best US model, the best Chinese model, and the gap between them. A model counts as American or Chinese based on where Epoch AI lists the company that made it.
Epoch Capabilities Index
Epoch Capabilities Index: best model over time
Higher is better. Each dot is a model, placed on the day it came out. The line steps up when a model sets a new record.
On Epoch Capabilities Index, the best US model, Claude Opus 5.5 at 167.33, is 9.88 points ahead of the best Chinese model, Kimi K3 at 157.45 (n = 65 scores). Released Sep 2026 (US) and Jul 2026 (China).
The scale doesn't start at zero, so gaps look bigger than they are.
Tap a dot to see the model, its exact score and the source. Arrow keys work too.
Show every score as a table
| Model | Country | Test | Score | Released | Source |
|---|---|---|---|---|---|
| GPT-6.1 SolOpenAI | US | Epoch Capabilities Index | 166.09 | Epoch AI, Epoch Capabilities Index | |
| Claude Sonnet 5.5Anthropic | US | Epoch Capabilities Index | 165.03 | Epoch AI, Epoch Capabilities Index | |
| Claude Opus 5.5Anthropic | US | Epoch Capabilities Index | 167.33 | Epoch AI, Epoch Capabilities Index | |
| GPT-6 SolOpenAI | US | Epoch Capabilities Index | 162.72 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek V4.1 FlashDeepSeek | China | Epoch Capabilities Index | 154.9 | Epoch AI, Epoch Capabilities Index | |
| GPT-6 AstraOpenAI | US | Epoch Capabilities Index | 166.45 | Epoch AI, Epoch Capabilities Index | |
| Muse Spark 1.3Meta AI | US | Epoch Capabilities Index | 156.75 | Epoch AI, Epoch Capabilities Index | |
| Claude Fable 5.1Anthropic | US | Epoch Capabilities Index | 164.7 | Epoch AI, Epoch Capabilities Index | |
| Qwen3.8 Max (0902)Alibaba (Qwen) | China | Epoch Capabilities Index | 155.05 | Epoch AI, Epoch Capabilities Index | |
| GLM-5.3-FlashZ.ai (Zhipu AI) | China | Epoch Capabilities Index | 151.88 | Epoch AI, Epoch Capabilities Index | |
| GLM-5.3Z.ai (Zhipu AI) | China | Epoch Capabilities Index | 155.61 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek V4 Pro 0813DeepSeek | China | Epoch Capabilities Index | 155.31 | Epoch AI, Epoch Capabilities Index | |
| Gemini 3.7 FlashGoogle DeepMind | US | Epoch Capabilities Index | 157.27 | Epoch AI, Epoch Capabilities Index | |
| Grok 4.6xAI | US | Epoch Capabilities Index | 156.44 | Epoch AI, Epoch Capabilities Index | |
| Qwen 3.8 MaxAlibaba (Qwen) | China | Epoch Capabilities Index | 156.41 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek V4 Flash 0731DeepSeek | China | Epoch Capabilities Index | 154.49 | Epoch AI, Epoch Capabilities Index | |
| Claude Opus 5Anthropic | US | Epoch Capabilities Index | 162.78 | Epoch AI, Epoch Capabilities Index | |
| Kimi K3Moonshot AI | China | Epoch Capabilities Index | 157.45 | Epoch AI, Epoch Capabilities Index | |
| Inkling-SmallThinking Machines Lab | US | Epoch Capabilities Index | 150.15 | Epoch AI, Epoch Capabilities Index | |
| GPT-5.6 SolOpenAI | US | Epoch Capabilities Index | 161.66 | Epoch AI, Epoch Capabilities Index | |
| GPT-5.6 TerraOpenAI | US | Epoch Capabilities Index | 159.62 | Epoch AI, Epoch Capabilities Index | |
| GLM-5.2Z.ai (Zhipu AI) | China | Epoch Capabilities Index | 151.78 | Epoch AI, Epoch Capabilities Index | |
| Claude Fable 5Anthropic | US | Epoch Capabilities Index | 162.06 | Epoch AI, Epoch Capabilities Index | |
| Nemotron 3 UltraNvidia | US | Epoch Capabilities Index | 146.17 | Epoch AI, Epoch Capabilities Index | |
| MiniMax-M3MiniMax | China | Epoch Capabilities Index | 146.95 | Epoch AI, Epoch Capabilities Index | |
| Claude Opus 4.8Anthropic | US | Epoch Capabilities Index | 158.21 | Epoch AI, Epoch Capabilities Index | |
| Qwen3.7-MaxAlibaba (Qwen) | China | Epoch Capabilities Index | 153.68 | Epoch AI, Epoch Capabilities Index | |
| GPT-5.5OpenAI | US | Epoch Capabilities Index | 159.1 | Epoch AI, Epoch Capabilities Index | |
| GPT-5.5 ProOpenAI | US | Epoch Capabilities Index | 162.07 | Epoch AI, Epoch Capabilities Index | |
| Kimi K2.6Moonshot AI | China | Epoch Capabilities Index | 151.05 | Epoch AI, Epoch Capabilities Index | |
| GLM-5.1Z.ai (Zhipu AI) | China | Epoch Capabilities Index | 149.84 | Epoch AI, Epoch Capabilities Index | |
| GPT-5.4 ProOpenAI | US | Epoch Capabilities Index | 158.93 | Epoch AI, Epoch Capabilities Index | |
| GPT-5.3 CodexOpenAI | US | Epoch Capabilities Index | 156.77 | Epoch AI, Epoch Capabilities Index | |
| Kimi K2.5Moonshot AI | China | Epoch Capabilities Index | 148.03 | Epoch AI, Epoch Capabilities Index | |
| GPT-5.2 ProOpenAI | US | Epoch Capabilities Index | 155.4 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek-V3.2DeepSeek | China | Epoch Capabilities Index | 146.27 | Epoch AI, Epoch Capabilities Index | |
| Gemini 3 ProGoogle DeepMind | US | Epoch Capabilities Index | 152.92 | Epoch AI, Epoch Capabilities Index | |
| Kimi K2 ThinkingMoonshot AI | China | Epoch Capabilities Index | 146.01 | Epoch AI, Epoch Capabilities Index | |
| GPT-5 ProOpenAI | US | Epoch Capabilities Index | 150.28 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek-V3.2-ExpDeepSeek | China | Epoch Capabilities Index | 145 | Epoch AI, Epoch Capabilities Index | |
| GPT-5OpenAI | US | Epoch Capabilities Index | 150 | Epoch AI, Epoch Capabilities Index | |
| Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen) | China | Epoch Capabilities Index | 143.85 | Epoch AI, Epoch Capabilities Index | |
| o3-proOpenAI | US | Epoch Capabilities Index | 147.42 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek-R1 (May 2025)DeepSeek | China | Epoch Capabilities Index | 141.29 | Epoch AI, Epoch Capabilities Index | |
| Qwen3-235B-A22BAlibaba (Qwen) | China | Epoch Capabilities Index | 139.35 | Epoch AI, Epoch Capabilities Index | |
| o3OpenAI | US | Epoch Capabilities Index | 146.86 | Epoch AI, Epoch Capabilities Index | |
| Gemini 2.5 Pro (Mar 2025)Google DeepMind | US | Epoch Capabilities Index | 144.16 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek-R1DeepSeek | China | Epoch Capabilities Index | 138.97 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek-V3DeepSeek | China | Epoch Capabilities Index | 132.34 | Epoch AI, Epoch Capabilities Index | |
| o1OpenAI | US | Epoch Capabilities Index | 141.91 | Epoch AI, Epoch Capabilities Index | |
| Qwen2.5-72BAlibaba (Qwen) | China | Epoch Capabilities Index | 129 | Epoch AI, Epoch Capabilities Index | |
| Qwen2.5-32BAlibaba (Qwen) | China | Epoch Capabilities Index | 128.52 | Epoch AI, Epoch Capabilities Index | |
| o1-miniOpenAI | US | Epoch Capabilities Index | 135.82 | Epoch AI, Epoch Capabilities Index | |
| Llama 3.1-405BMeta AI | US | Epoch Capabilities Index | 128.75 | Epoch AI, Epoch Capabilities Index | |
| Claude 3.5 SonnetAnthropic | US | Epoch Capabilities Index | 130 | Epoch AI, Epoch Capabilities Index | |
| Qwen2-72BAlibaba (Qwen) | China | Epoch Capabilities Index | 125.28 | Epoch AI, Epoch Capabilities Index | |
| GPT-4o (May 2024)OpenAI | US | Epoch Capabilities Index | 128.97 | Epoch AI, Epoch Capabilities Index | |
| DeepSeek-V2 (MoE-236B, May 2024)DeepSeek | China | Epoch Capabilities Index | 124.77 | Epoch AI, Epoch Capabilities Index | |
| GPT-4 Turbo (Apr 2024)OpenAI | US | Epoch Capabilities Index | 127.25 | Epoch AI, Epoch Capabilities Index | |
| Claude 3 OpusAnthropic | US | Epoch Capabilities Index | 126.91 | Epoch AI, Epoch Capabilities Index | |
| GPT-4 Turbo (Nov 2023)OpenAI | US | Epoch Capabilities Index | 126.46 | Epoch AI, Epoch Capabilities Index | |
| Yi-34B01.AI | China | Epoch Capabilities Index | 117.39 | Epoch AI, Epoch Capabilities Index | |
| Qwen-14BAlibaba (Qwen) | China | Epoch Capabilities Index | 113.03 | Epoch AI, Epoch Capabilities Index | |
| GPT-4 (Mar 2023)OpenAI | US | Epoch Capabilities Index | 125.89 | Epoch AI, Epoch Capabilities Index | |
| LLaMA-65BMeta AI | US | Epoch Capabilities Index | 110.17 | Epoch AI, Epoch Capabilities Index |
Source: Epoch AI (CC BY 4.0). Each score links to its page in the table.
FrontierMath-Tiers-1-3-v2-Private
FrontierMath-Tiers-1-3-v2-Private: best model over time
Higher is better. Each dot is a model, placed on the day it came out. The line steps up when a model sets a new record.
On FrontierMath-Tiers-1-3-v2-Private, the best US model, GPT-6 Astra at 93.7%, is 19 percentage points ahead of the best Chinese model, Qwen 3.8 Max at 74.7% (n = 35 scores). Released Sep 2026 (US) and Aug 2026 (China).
Tap a dot to see the model, its exact score and the source. Arrow keys work too.
Show every score as a table
| Model | Country | Test | Score | Released | Source |
|---|---|---|---|---|---|
| GPT-6.1 SolOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 93.7 | Epoch AI, Benchmarking Hub | |
| Claude Sonnet 5.5Anthropic | US | FrontierMath-Tiers-1-3-v2-Private | 88.8 | Epoch AI, Benchmarking Hub | |
| Claude Opus 5.5Anthropic | US | FrontierMath-Tiers-1-3-v2-Private | 91.2 | Epoch AI, Benchmarking Hub | |
| GPT-6 SolOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 89.8 | Epoch AI, Benchmarking Hub | |
| GPT-6 AstraOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 93.7 | Epoch AI, Benchmarking Hub | |
| Muse Spark 1.3Meta AI | US | FrontierMath-Tiers-1-3-v2-Private | 74.4 | Epoch AI, Benchmarking Hub | |
| Claude Fable 5.1Anthropic | US | FrontierMath-Tiers-1-3-v2-Private | 90.2 | Epoch AI, Benchmarking Hub | |
| Qwen3.8 Max (0902)Alibaba (Qwen) | China | FrontierMath-Tiers-1-3-v2-Private | 65.6 | Epoch AI, Benchmarking Hub | |
| GLM-5.3-FlashZ.ai (Zhipu AI) | China | FrontierMath-Tiers-1-3-v2-Private | 55.8 | Epoch AI, Benchmarking Hub | |
| GLM-5.3Z.ai (Zhipu AI) | China | FrontierMath-Tiers-1-3-v2-Private | 68.8 | Epoch AI, Benchmarking Hub | |
| DeepSeek V4 Pro 0813DeepSeek | China | FrontierMath-Tiers-1-3-v2-Private | 64.6 | Epoch AI, Benchmarking Hub | |
| Gemini 3.7 FlashGoogle DeepMind | US | FrontierMath-Tiers-1-3-v2-Private | 71.6 | Epoch AI, Benchmarking Hub | |
| Grok 4.6xAI | US | FrontierMath-Tiers-1-3-v2-Private | 66 | Epoch AI, Benchmarking Hub | |
| Qwen 3.8 MaxAlibaba (Qwen) | China | FrontierMath-Tiers-1-3-v2-Private | 74.7 | Epoch AI, Benchmarking Hub | |
| DeepSeek V4 Flash 0731DeepSeek | China | FrontierMath-Tiers-1-3-v2-Private | 57.5 | Epoch AI, Benchmarking Hub | |
| Claude Opus 5Anthropic | US | FrontierMath-Tiers-1-3-v2-Private | 85.6 | Epoch AI, Benchmarking Hub | |
| Kimi K3Moonshot AI | China | FrontierMath-Tiers-1-3-v2-Private | 72.2 | Epoch AI, Benchmarking Hub | |
| Inkling-SmallThinking Machines Lab | US | FrontierMath-Tiers-1-3-v2-Private | 46.3 | Epoch AI, Benchmarking Hub | |
| GPT-5.6 SolOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 89.1 | Epoch AI, Benchmarking Hub | |
| GPT-5.6 TerraOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 86 | Epoch AI, Benchmarking Hub | |
| GLM-5.2Z.ai (Zhipu AI) | China | FrontierMath-Tiers-1-3-v2-Private | 59.2 | Epoch AI, Benchmarking Hub | |
| Claude Fable 5Anthropic | US | FrontierMath-Tiers-1-3-v2-Private | 87 | Epoch AI, Benchmarking Hub | |
| Claude Opus 4.8Anthropic | US | FrontierMath-Tiers-1-3-v2-Private | 80 | Epoch AI, Benchmarking Hub | |
| Qwen3.7-MaxAlibaba (Qwen) | China | FrontierMath-Tiers-1-3-v2-Private | 64.6 | Epoch AI, Benchmarking Hub | |
| GPT-5.5OpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 85.3 | Epoch AI, Benchmarking Hub | |
| GPT-5.5 ProOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 87.7 | Epoch AI, Benchmarking Hub | |
| Kimi K2.6Moonshot AI | China | FrontierMath-Tiers-1-3-v2-Private | 57.2 | Epoch AI, Benchmarking Hub | |
| GLM-5.1Z.ai (Zhipu AI) | China | FrontierMath-Tiers-1-3-v2-Private | 36.8 | Epoch AI, Benchmarking Hub | |
| GPT-5.4 ProOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 82.5 | Epoch AI, Benchmarking Hub | |
| GPT-5.2 ProOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 74 | Epoch AI, Benchmarking Hub | |
| GPT-5 ProOpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 55.8 | Epoch AI, Benchmarking Hub | |
| GPT-5OpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 55.4 | Epoch AI, Benchmarking Hub | |
| o3OpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 33.3 | Epoch AI, Benchmarking Hub | |
| o1OpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 14.7 | Epoch AI, Benchmarking Hub | |
| GPT-4 Turbo (Apr 2024)OpenAI | US | FrontierMath-Tiers-1-3-v2-Private | 0.7 | Epoch AI, Benchmarking Hub |
Source: Epoch AI (CC BY 4.0). Each score links to its page in the table.
GPQA diamond
GPQA diamond: best model over time
Higher is better. Each dot is a model, placed on the day it came out. The line steps up when a model sets a new record.
On GPQA diamond, the best US model, GPT-6 Astra at 94.4%, is 3.6 percentage points ahead of the best Chinese model, Kimi K3 at 90.8% (n = 54 scores). Released Sep 2026 (US) and Jul 2026 (China).
Tap a dot to see the model, its exact score and the source. Arrow keys work too.
Show every score as a table
| Model | Country | Test | Score | Released | Source |
|---|---|---|---|---|---|
| GPT-6.1 SolOpenAI | US | GPQA diamond | 93.9 | Epoch AI, Benchmarking Hub | |
| Claude Sonnet 5.5Anthropic | US | GPQA diamond | 94.1 | Epoch AI, Benchmarking Hub | |
| Claude Opus 5.5Anthropic | US | GPQA diamond | 87.5 | Epoch AI, Benchmarking Hub | |
| GPT-6 SolOpenAI | US | GPQA diamond | 92.4 | Epoch AI, Benchmarking Hub | |
| GPT-6 AstraOpenAI | US | GPQA diamond | 94.4 | Epoch AI, Benchmarking Hub | |
| Qwen3.8 Max (0902)Alibaba (Qwen) | China | GPQA diamond | 89.7 | Epoch AI, Benchmarking Hub | |
| GLM-5.3-FlashZ.ai (Zhipu AI) | China | GPQA diamond | 86.9 | Epoch AI, Benchmarking Hub | |
| GLM-5.3Z.ai (Zhipu AI) | China | GPQA diamond | 87.9 | Epoch AI, Benchmarking Hub | |
| DeepSeek V4 Pro 0813DeepSeek | China | GPQA diamond | 88.9 | Epoch AI, Benchmarking Hub | |
| Gemini 3.7 FlashGoogle DeepMind | US | GPQA diamond | 93.1 | Epoch AI, Benchmarking Hub | |
| Grok 4.6xAI | US | GPQA diamond | 92 | Epoch AI, Benchmarking Hub | |
| Qwen 3.8 MaxAlibaba (Qwen) | China | GPQA diamond | 90.2 | Epoch AI, Benchmarking Hub | |
| DeepSeek V4 Flash 0731DeepSeek | China | GPQA diamond | 88 | Epoch AI, Benchmarking Hub | |
| Claude Opus 5Anthropic | US | GPQA diamond | 91.8 | Epoch AI, Benchmarking Hub | |
| Kimi K3Moonshot AI | China | GPQA diamond | 90.8 | Epoch AI, Benchmarking Hub | |
| Inkling-SmallThinking Machines Lab | US | GPQA diamond | 84.7 | Epoch AI, Benchmarking Hub | |
| GPT-5.6 SolOpenAI | US | GPQA diamond | 91.3 | Epoch AI, Benchmarking Hub | |
| GPT-5.6 TerraOpenAI | US | GPQA diamond | 91.1 | Epoch AI, Benchmarking Hub | |
| GLM-5.2Z.ai (Zhipu AI) | China | GPQA diamond | 89.1 | Epoch AI, Benchmarking Hub | |
| Claude Fable 5Anthropic | US | GPQA diamond | 81.1 | Epoch AI, Benchmarking Hub | |
| Nemotron 3 UltraNvidia | US | GPQA diamond | 80.5 | Epoch AI, Benchmarking Hub | |
| MiniMax-M3MiniMax | China | GPQA diamond | 87.9 | Epoch AI, Benchmarking Hub | |
| Claude Opus 4.8Anthropic | US | GPQA diamond | 88 | Epoch AI, Benchmarking Hub | |
| Qwen3.7-MaxAlibaba (Qwen) | China | GPQA diamond | 87.9 | Epoch AI, Benchmarking Hub | |
| GPT-5.5OpenAI | US | GPQA diamond | 92 | Epoch AI, Benchmarking Hub | |
| GPT-5.5 ProOpenAI | US | GPQA diamond | 91.9 | Epoch AI, Benchmarking Hub | |
| Kimi K2.6Moonshot AI | China | GPQA diamond | 87.7 | Epoch AI, Benchmarking Hub | |
| GLM-5.1Z.ai (Zhipu AI) | China | GPQA diamond | 86.5 | Epoch AI, Benchmarking Hub | |
| GPT-5.4 ProOpenAI | US | GPQA diamond | 92.8 | Epoch AI, Benchmarking Hub | |
| Kimi K2.5Moonshot AI | China | GPQA diamond | 83.5 | Epoch AI, Benchmarking Hub | |
| DeepSeek-V3.2DeepSeek | China | GPQA diamond | 77.9 | Epoch AI, Benchmarking Hub | |
| Gemini 3 ProGoogle DeepMind | US | GPQA diamond | 90.2 | Epoch AI, Benchmarking Hub | |
| Kimi K2 ThinkingMoonshot AI | China | GPQA diamond | 79 | Epoch AI, Benchmarking Hub | |
| GPT-5OpenAI | US | GPQA diamond | 81.6 | Epoch AI, Benchmarking Hub | |
| Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen) | China | GPQA diamond | 73.4 | Epoch AI, Benchmarking Hub | |
| DeepSeek-R1 (May 2025)DeepSeek | China | GPQA diamond | 68.4 | Epoch AI, Benchmarking Hub | |
| Qwen3-235B-A22BAlibaba (Qwen) | China | GPQA diamond | 60.9 | Epoch AI, Benchmarking Hub | |
| o3OpenAI | US | GPQA diamond | 75.8 | Epoch AI, Benchmarking Hub | |
| Gemini 2.5 Pro (Mar 2025)Google DeepMind | US | GPQA diamond | 78.5 | Epoch AI, Benchmarking Hub | |
| DeepSeek-R1DeepSeek | China | GPQA diamond | 62.3 | Epoch AI, Benchmarking Hub | |
| DeepSeek-V3DeepSeek | China | GPQA diamond | 42 | Epoch AI, Benchmarking Hub | |
| o1OpenAI | US | GPQA diamond | 69 | Epoch AI, Benchmarking Hub | |
| Qwen2.5-72BAlibaba (Qwen) | China | GPQA diamond | 32.2 | Epoch AI, Benchmarking Hub | |
| Qwen2.5-32BAlibaba (Qwen) | China | GPQA diamond | 28.1 | Epoch AI, Benchmarking Hub | |
| o1-miniOpenAI | US | GPQA diamond | 49.8 | Epoch AI, Benchmarking Hub | |
| Llama 3.1-405BMeta AI | US | GPQA diamond | 34.6 | Epoch AI, Benchmarking Hub | |
| Claude 3.5 SonnetAnthropic | US | GPQA diamond | 38.7 | Epoch AI, Benchmarking Hub | |
| Qwen2-72BAlibaba (Qwen) | China | GPQA diamond | 21 | Epoch AI, Benchmarking Hub | |
| GPT-4o (May 2024)OpenAI | US | GPQA diamond | 31.9 | Epoch AI, Benchmarking Hub | |
| GPT-4 Turbo (Apr 2024)OpenAI | US | GPQA diamond | 28.8 | Epoch AI, Benchmarking Hub | |
| Claude 3 OpusAnthropic | US | GPQA diamond | 29.5 | Epoch AI, Benchmarking Hub | |
| GPT-4 Turbo (Nov 2023)OpenAI | US | GPQA diamond | 23.1 | Epoch AI, Benchmarking Hub | |
| Yi-34B01.AI | China | GPQA diamond | 0 | Epoch AI, Benchmarking Hub | |
| GPT-4 (Mar 2023)OpenAI | US | GPQA diamond | 14.3 | Epoch AI, Benchmarking Hub |
Source: Epoch AI (CC BY 4.0). Each score links to its page in the table.
OTIS Mock AIME 2024-2025
OTIS Mock AIME 2024-2025: best model over time
Higher is better. Each dot is a model, placed on the day it came out. The line steps up when a model sets a new record.
The best US model (GPT-5.5) and the best Chinese model (Qwen3.8 Max (0902)) are tied on OTIS Mock AIME 2024-2025 at 100% (n = 50 scores). Released Apr 2026 (US) and Sep 2026 (China).
Tap a dot to see the model, its exact score and the source. Arrow keys work too.
Show every score as a table
| Model | Country | Test | Score | Released | Source |
|---|---|---|---|---|---|
| GPT-6.1 SolOpenAI | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| Claude Sonnet 5.5Anthropic | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| Claude Opus 5.5Anthropic | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| GPT-6 SolOpenAI | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| GPT-6 AstraOpenAI | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| Muse Spark 1.3Meta AI | US | OTIS Mock AIME 2024-2025 | 99.2 | Epoch AI, Benchmarking Hub | |
| Claude Fable 5.1Anthropic | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| Qwen3.8 Max (0902)Alibaba (Qwen) | China | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| GLM-5.3-FlashZ.ai (Zhipu AI) | China | OTIS Mock AIME 2024-2025 | 93.9 | Epoch AI, Benchmarking Hub | |
| GLM-5.3Z.ai (Zhipu AI) | China | OTIS Mock AIME 2024-2025 | 91.1 | Epoch AI, Benchmarking Hub | |
| DeepSeek V4 Pro 0813DeepSeek | China | OTIS Mock AIME 2024-2025 | 98.6 | Epoch AI, Benchmarking Hub | |
| Gemini 3.7 FlashGoogle DeepMind | US | OTIS Mock AIME 2024-2025 | 97.2 | Epoch AI, Benchmarking Hub | |
| Grok 4.6xAI | US | OTIS Mock AIME 2024-2025 | 99.2 | Epoch AI, Benchmarking Hub | |
| Qwen 3.8 MaxAlibaba (Qwen) | China | OTIS Mock AIME 2024-2025 | 99.4 | Epoch AI, Benchmarking Hub | |
| DeepSeek V4 Flash 0731DeepSeek | China | OTIS Mock AIME 2024-2025 | 94.4 | Epoch AI, Benchmarking Hub | |
| Claude Opus 5Anthropic | US | OTIS Mock AIME 2024-2025 | 98.9 | Epoch AI, Benchmarking Hub | |
| Kimi K3Moonshot AI | China | OTIS Mock AIME 2024-2025 | 97.2 | Epoch AI, Benchmarking Hub | |
| Inkling-SmallThinking Machines Lab | US | OTIS Mock AIME 2024-2025 | 90 | Epoch AI, Benchmarking Hub | |
| GPT-5.6 SolOpenAI | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| GPT-5.6 TerraOpenAI | US | OTIS Mock AIME 2024-2025 | 99.7 | Epoch AI, Benchmarking Hub | |
| GLM-5.2Z.ai (Zhipu AI) | China | OTIS Mock AIME 2024-2025 | 86.4 | Epoch AI, Benchmarking Hub | |
| Claude Fable 5Anthropic | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| Nemotron 3 UltraNvidia | US | OTIS Mock AIME 2024-2025 | 86.7 | Epoch AI, Benchmarking Hub | |
| MiniMax-M3MiniMax | China | OTIS Mock AIME 2024-2025 | 71.1 | Epoch AI, Benchmarking Hub | |
| Claude Opus 4.8Anthropic | US | OTIS Mock AIME 2024-2025 | 98.3 | Epoch AI, Benchmarking Hub | |
| Qwen3.7-MaxAlibaba (Qwen) | China | OTIS Mock AIME 2024-2025 | 95.6 | Epoch AI, Benchmarking Hub | |
| GPT-5.5OpenAI | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| GPT-5.5 ProOpenAI | US | OTIS Mock AIME 2024-2025 | 100 | Epoch AI, Benchmarking Hub | |
| Kimi K2.6Moonshot AI | China | OTIS Mock AIME 2024-2025 | 96.1 | Epoch AI, Benchmarking Hub | |
| GLM-5.1Z.ai (Zhipu AI) | China | OTIS Mock AIME 2024-2025 | 93.3 | Epoch AI, Benchmarking Hub | |
| Kimi K2.5Moonshot AI | China | OTIS Mock AIME 2024-2025 | 92.2 | Epoch AI, Benchmarking Hub | |
| DeepSeek-V3.2DeepSeek | China | OTIS Mock AIME 2024-2025 | 87.8 | Epoch AI, Benchmarking Hub | |
| Gemini 3 ProGoogle DeepMind | US | OTIS Mock AIME 2024-2025 | 91.4 | Epoch AI, Benchmarking Hub | |
| Kimi K2 ThinkingMoonshot AI | China | OTIS Mock AIME 2024-2025 | 83 | Epoch AI, Benchmarking Hub | |
| GPT-5OpenAI | US | OTIS Mock AIME 2024-2025 | 91.4 | Epoch AI, Benchmarking Hub | |
| Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen) | China | OTIS Mock AIME 2024-2025 | 86.7 | Epoch AI, Benchmarking Hub | |
| DeepSeek-R1 (May 2025)DeepSeek | China | OTIS Mock AIME 2024-2025 | 66.4 | Epoch AI, Benchmarking Hub | |
| o3OpenAI | US | OTIS Mock AIME 2024-2025 | 84.4 | Epoch AI, Benchmarking Hub | |
| DeepSeek-R1DeepSeek | China | OTIS Mock AIME 2024-2025 | 53.3 | Epoch AI, Benchmarking Hub | |
| DeepSeek-V3DeepSeek | China | OTIS Mock AIME 2024-2025 | 15.7 | Epoch AI, Benchmarking Hub | |
| o1OpenAI | US | OTIS Mock AIME 2024-2025 | 73.3 | Epoch AI, Benchmarking Hub | |
| Qwen2.5-72BAlibaba (Qwen) | China | OTIS Mock AIME 2024-2025 | 8 | Epoch AI, Benchmarking Hub | |
| Qwen2.5-32BAlibaba (Qwen) | China | OTIS Mock AIME 2024-2025 | 7.3 | Epoch AI, Benchmarking Hub | |
| o1-miniOpenAI | US | OTIS Mock AIME 2024-2025 | 46.9 | Epoch AI, Benchmarking Hub | |
| Llama 3.1-405BMeta AI | US | OTIS Mock AIME 2024-2025 | 9.6 | Epoch AI, Benchmarking Hub | |
| Claude 3.5 SonnetAnthropic | US | OTIS Mock AIME 2024-2025 | 6.4 | Epoch AI, Benchmarking Hub | |
| GPT-4o (May 2024)OpenAI | US | OTIS Mock AIME 2024-2025 | 6.2 | Epoch AI, Benchmarking Hub | |
| GPT-4 Turbo (Apr 2024)OpenAI | US | OTIS Mock AIME 2024-2025 | 6.6 | Epoch AI, Benchmarking Hub | |
| Claude 3 OpusAnthropic | US | OTIS Mock AIME 2024-2025 | 4.6 | Epoch AI, Benchmarking Hub | |
| GPT-4 (Mar 2023)OpenAI | US | OTIS Mock AIME 2024-2025 | 0.5 | Epoch AI, Benchmarking Hub |
Source: Epoch AI (CC BY 4.0). Each score links to its page in the table.
Questions
How is the US vs China lead measured?
For each public test, we compare the top-scoring US model with the top-scoring Chinese model. We never average different tests together.