Anthropic
Claude Fable 5 (with fallback)
#1
AA Intelligence Index
60
综合能力分数
上下文窗口
1M
输入容量
Claude Fable 5 (with fallback) capability radar 100% Intelligence 69% Agentic 100% Coding 80% Science 100% Reasoning 100% Knowledge
Agentic 26.8%
Coding 60.2%
Science 92.6%
Reasoning 53.3%
Knowledge 40.1
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
Anthropic
Claude Opus 4.8 (max)
#2
AA Intelligence Index
56
综合能力分数
上下文窗口
1M
输入容量
Claude Opus 4.8 (max) capability radar 79% Intelligence 75% Agentic 55% Coding 72% Science 61% Reasoning 67% Knowledge
Agentic 27.6%
Coding 53.5%
Science 92.0%
Reasoning 45.7%
Knowledge 27.4
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
55
综合能力分数
上下文窗口
922k
输入容量
GPT-5.5 (xhigh) capability radar 74% Intelligence 100% Agentic 73% Coding 92% Science 54% Reasoning 48% Knowledge
Agentic 31.3%
Coding 56.1%
Science 93.5%
Reasoning 44.3%
Knowledge 20.1
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
Anthropic
Claude Opus 4.7 (max)
#4
AA Intelligence Index
54
综合能力分数
上下文窗口
1M
输入容量
Claude Opus 4.7 (max) capability radar 68% Intelligence 83% Agentic 12% Coding 12% Science 12% Reasoning 12% Knowledge
Agentic 28.9%
Coding --
Science --
Reasoning --
Knowledge --
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
Anthropic
Claude Sonnet 5 (max)
#5
AA Intelligence Index
53
综合能力分数
上下文窗口
1M
输入容量
Claude Sonnet 5 (max) capability radar 63% Intelligence 79% Agentic 55% Coding 60% Science 30% Reasoning 36% Knowledge
Agentic 28.2%
Coding 53.6%
Science 91.1%
Reasoning 39.6%
Knowledge 15.3
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
53
综合能力分数
上下文窗口
922k
输入容量
GPT-5.5 (high) capability radar 63% Intelligence 87% Agentic 73% Coding 88% Science 47% Reasoning 48% Knowledge
Agentic 29.5%
Coding 56.1%
Science 93.2%
Reasoning 43.0%
Knowledge 20.1
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
51
综合能力分数
上下文窗口
1M
输入容量
GLM-5.2 (max) capability radar 53% Intelligence 69% Agentic 34% Coding 39% Science 32% Reasoning 12% Knowledge
Agentic 26.8%
Coding 50.5%
Science 89.5%
Reasoning 40.1%
Knowledge 4.0
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
50
综合能力分数
上下文窗口
922k
输入容量
GPT-5.5 (medium) capability radar 47% Intelligence 12% Agentic 73% Coding 80% Science 12% Reasoning 48% Knowledge
Agentic --
Coding 56.1%
Science 92.6%
Reasoning --
Knowledge 20.1
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
50
综合能力分数
上下文窗口
1M
输入容量
Gemini 3.5 Flash capability radar 47% Intelligence 60% Agentic 52% Coding 75% Science 37% Reasoning 55% Knowledge
Agentic 25.4%
Coding 53.1%
Science 92.2%
Reasoning 41.0%
Knowledge 22.7
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
Google
Gemini 3.1 Pro Preview
#10
AA Intelligence Index
46
综合能力分数
上下文窗口
1M
输入容量
Gemini 3.1 Pro Preview capability radar 26% Intelligence 12% Agentic 91% Coding 100% Science 56% Reasoning 81% Knowledge
Agentic 16.5%
Coding 58.9%
Science 94.1%
Reasoning 44.7%
Knowledge 32.9
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
46
综合能力分数
上下文窗口
1M
输入容量
Qwen3.7 Max capability radar 26% Intelligence 12% Agentic 23% Coding 76% Science 22% Reasoning 33% Knowledge
Agentic --
Coding 48.8%
Science 92.3%
Reasoning 38.1%
Knowledge 14.1
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
Google
Gemini 3.5 Flash (medium)
#12
AA Intelligence Index
45*
综合能力分数
上下文窗口
1M
输入容量
Gemini 3.5 Flash (medium) capability radar 21% Intelligence 60% Agentic 52% Coding 75% Science 37% Reasoning 55% Knowledge
Agentic 25.4%
Coding 53.1%
Science 92.2%
Reasoning 41.0%
Knowledge 22.7
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
44
综合能力分数
上下文窗口
1M
输入容量
MiniMax-M3 capability radar 16% Intelligence 12% Agentic 12% Coding 84% Science 17% Reasoning 12% Knowledge
Agentic --
Coding 45.4%
Science 92.9%
Reasoning 37.1%
Knowledge 1.4
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
DeepSeek
DeepSeek V4 Pro (max)
#14
AA Intelligence Index
44
综合能力分数
上下文窗口
1M
输入容量
DeepSeek V4 Pro (max) capability radar 16% Intelligence 63% Agentic 31% Coding 29% Science 12% Reasoning 12% Knowledge
Agentic 25.8%
Coding 50.0%
Science 88.8%
Reasoning 35.9%
Knowledge --
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
OpenAI
GPT-5.3 Codex (xhigh)
#15
AA Intelligence Index
44*
综合能力分数
上下文窗口
400k
输入容量
GPT-5.3 Codex (xhigh) capability radar 16% Intelligence 12% Agentic 12% Coding 12% Science 12% Reasoning 12% Knowledge
Agentic --
Coding --
Science --
Reasoning --
Knowledge --
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
43
综合能力分数
上下文窗口
922k
输入容量
GPT-5.5 (low) capability radar 12% Intelligence 12% Agentic 73% Coding 12% Science 12% Reasoning 48% Knowledge
Agentic --
Coding 56.1%
Science --
Reasoning --
Knowledge 20.1
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
43
综合能力分数
上下文窗口
262k
输入容量
Muse Spark capability radar 12% Intelligence 21% Agentic 41% Coding 24% Science 32% Reasoning 12% Knowledge
Agentic 19.6%
Coding 51.5%
Science 88.4%
Reasoning 39.9%
Knowledge 4.1
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
43
综合能力分数
上下文窗口
256k
输入容量
Kimi K2.6 capability radar 12% Intelligence 28% Agentic 55% Coding 60% Science 12% Reasoning 13% Knowledge
Agentic 20.6%
Coding 53.5%
Science 91.1%
Reasoning 35.9%
Knowledge 6.4
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
Anthropic
Claude Opus 4.7 (Non-reasoning, high)
#19
AA Intelligence Index
43*
综合能力分数
上下文窗口
1M
输入容量
Claude Opus 4.7 (Non-reasoning, high) capability radar 12% Intelligence 83% Agentic 12% Coding 12% Science 12% Reasoning 12% Knowledge
Agentic 28.9%
Coding --
Science --
Reasoning --
Knowledge --
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
42
综合能力分数
上下文窗口
1M
输入容量
MiMo-V2.5-Pro capability radar 12% Intelligence 12% Agentic 33% Coding 12% Science 12% Reasoning 12% Knowledge
Agentic --
Coding 50.2%
Science 86.6%
Reasoning 33.8%
Knowledge 3.6
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
42
综合能力分数
上下文窗口
256k
输入容量
Kimi K2.7 Code capability radar 12% Intelligence 12% Agentic 12% Coding 12% Science 12% Reasoning 12% Knowledge
Agentic --
Coding --
Science --
Reasoning --
Knowledge --
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
Anthropic
Claude Sonnet 5 (Non-reasoning)
#22
AA Intelligence Index
42
综合能力分数
上下文窗口
1M
输入容量
Claude Sonnet 5 (Non-reasoning) capability radar 12% Intelligence 79% Agentic 55% Coding 60% Science 30% Reasoning 36% Knowledge
Agentic 28.2%
Coding 53.6%
Science 91.1%
Reasoning 39.6%
Knowledge 15.3
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
AA Intelligence Index
41
综合能力分数
上下文窗口
262k
输入容量
Nex-N2-Pro capability radar 12% Intelligence 12% Agentic 12% Coding 12% Science 12% Reasoning 12% Knowledge
Agentic --
Coding --
Science --
Reasoning --
Knowledge --
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。
DeepSeek
DeepSeek V4 Pro (high)
#24
AA Intelligence Index
41*
综合能力分数
上下文窗口
1M
输入容量
DeepSeek V4 Pro (high) capability radar 12% Intelligence 63% Agentic 31% Coding 29% Science 12% Reasoning 12% Knowledge
Agentic 25.8%
Coding 50.0%
Science 88.8%
Reasoning 35.9%
Knowledge --
Radar AA benchmarks
能力雷达使用六个 Artificial Analysis benchmark 家族;百分比标签是在本头部模型集合内归一化后的相对值。