Skip to main content
🤖 AI Toolset
Artificial Analysis cards

Best AI Models by Intelligence Index

Visual cards for the top models ranked by Artificial Analysis. Each card includes a six-axis capability radar from AA benchmark families.

This page uses Artificial Analysis data with visible attribution. The values are a snapshot and may change; use the linked source for the latest official numbers.
Top ranked models

Artificial Analysis model cards

Each card shows the Intelligence Index, context window, and a six-axis capability radar built from Artificial Analysis benchmark scores.

Source leaderboard

Anthropic

Claude Fable 5 (with fallback)

#1
AA Intelligence Index 60 Composite capability score
Context window 1M Input capacity
Claude Fable 5 (with fallback) capability radar100%Intelligence69%Agentic100%Coding80%Science100%Reasoning100%Knowledge
Agentic
26.8%
Coding
60.2%
Science
92.6%
Reasoning
53.3%
Knowledge
40.1
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Anthropic

Claude Opus 4.8 (max)

#2
AA Intelligence Index 56 Composite capability score
Context window 1M Input capacity
Claude Opus 4.8 (max) capability radar79%Intelligence75%Agentic55%Coding72%Science61%Reasoning67%Knowledge
Agentic
27.6%
Coding
53.5%
Science
92.0%
Reasoning
45.7%
Knowledge
27.4
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

OpenAI

GPT-5.5 (xhigh)

#3
AA Intelligence Index 55 Composite capability score
Context window 922k Input capacity
GPT-5.5 (xhigh) capability radar74%Intelligence100%Agentic73%Coding92%Science54%Reasoning48%Knowledge
Agentic
31.3%
Coding
56.1%
Science
93.5%
Reasoning
44.3%
Knowledge
20.1
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Anthropic

Claude Opus 4.7 (max)

#4
AA Intelligence Index 54 Composite capability score
Context window 1M Input capacity
Claude Opus 4.7 (max) capability radar68%Intelligence83%Agentic12%Coding12%Science12%Reasoning12%Knowledge
Agentic
28.9%
Coding
--
Science
--
Reasoning
--
Knowledge
--
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Anthropic

Claude Sonnet 5 (max)

#5
AA Intelligence Index 53 Composite capability score
Context window 1M Input capacity
Claude Sonnet 5 (max) capability radar63%Intelligence79%Agentic55%Coding60%Science30%Reasoning36%Knowledge
Agentic
28.2%
Coding
53.6%
Science
91.1%
Reasoning
39.6%
Knowledge
15.3
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

OpenAI

GPT-5.5 (high)

#6
AA Intelligence Index 53 Composite capability score
Context window 922k Input capacity
GPT-5.5 (high) capability radar63%Intelligence87%Agentic73%Coding88%Science47%Reasoning48%Knowledge
Agentic
29.5%
Coding
56.1%
Science
93.2%
Reasoning
43.0%
Knowledge
20.1
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Z AI

GLM-5.2 (max)

#7
AA Intelligence Index 51 Composite capability score
Context window 1M Input capacity
GLM-5.2 (max) capability radar53%Intelligence69%Agentic34%Coding39%Science32%Reasoning12%Knowledge
Agentic
26.8%
Coding
50.5%
Science
89.5%
Reasoning
40.1%
Knowledge
4.0
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

OpenAI

GPT-5.5 (medium)

#8
AA Intelligence Index 50 Composite capability score
Context window 922k Input capacity
GPT-5.5 (medium) capability radar47%Intelligence12%Agentic73%Coding80%Science12%Reasoning48%Knowledge
Agentic
--
Coding
56.1%
Science
92.6%
Reasoning
--
Knowledge
20.1
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Google

Gemini 3.5 Flash

#9
AA Intelligence Index 50 Composite capability score
Context window 1M Input capacity
Gemini 3.5 Flash capability radar47%Intelligence60%Agentic52%Coding75%Science37%Reasoning55%Knowledge
Agentic
25.4%
Coding
53.1%
Science
92.2%
Reasoning
41.0%
Knowledge
22.7
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Google

Gemini 3.1 Pro Preview

#10
AA Intelligence Index 46 Composite capability score
Context window 1M Input capacity
Gemini 3.1 Pro Preview capability radar26%Intelligence12%Agentic91%Coding100%Science56%Reasoning81%Knowledge
Agentic
16.5%
Coding
58.9%
Science
94.1%
Reasoning
44.7%
Knowledge
32.9
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Alibaba

Qwen3.7 Max

#11
AA Intelligence Index 46 Composite capability score
Context window 1M Input capacity
Qwen3.7 Max capability radar26%Intelligence12%Agentic23%Coding76%Science22%Reasoning33%Knowledge
Agentic
--
Coding
48.8%
Science
92.3%
Reasoning
38.1%
Knowledge
14.1
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Google

Gemini 3.5 Flash (medium)

#12
AA Intelligence Index 45* Composite capability score
Context window 1M Input capacity
Gemini 3.5 Flash (medium) capability radar21%Intelligence60%Agentic52%Coding75%Science37%Reasoning55%Knowledge
Agentic
25.4%
Coding
53.1%
Science
92.2%
Reasoning
41.0%
Knowledge
22.7
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

MiniMax

MiniMax-M3

#13
AA Intelligence Index 44 Composite capability score
Context window 1M Input capacity
MiniMax-M3 capability radar16%Intelligence12%Agentic12%Coding84%Science17%Reasoning12%Knowledge
Agentic
--
Coding
45.4%
Science
92.9%
Reasoning
37.1%
Knowledge
1.4
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

DeepSeek

DeepSeek V4 Pro (max)

#14
AA Intelligence Index 44 Composite capability score
Context window 1M Input capacity
DeepSeek V4 Pro (max) capability radar16%Intelligence63%Agentic31%Coding29%Science12%Reasoning12%Knowledge
Agentic
25.8%
Coding
50.0%
Science
88.8%
Reasoning
35.9%
Knowledge
--
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

OpenAI

GPT-5.3 Codex (xhigh)

#15
AA Intelligence Index 44* Composite capability score
Context window 400k Input capacity
GPT-5.3 Codex (xhigh) capability radar16%Intelligence12%Agentic12%Coding12%Science12%Reasoning12%Knowledge
Agentic
--
Coding
--
Science
--
Reasoning
--
Knowledge
--
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

OpenAI

GPT-5.5 (low)

#16
AA Intelligence Index 43 Composite capability score
Context window 922k Input capacity
GPT-5.5 (low) capability radar12%Intelligence12%Agentic73%Coding12%Science12%Reasoning48%Knowledge
Agentic
--
Coding
56.1%
Science
--
Reasoning
--
Knowledge
20.1
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Meta

Muse Spark

#17
AA Intelligence Index 43 Composite capability score
Context window 262k Input capacity
Muse Spark capability radar12%Intelligence21%Agentic41%Coding24%Science32%Reasoning12%Knowledge
Agentic
19.6%
Coding
51.5%
Science
88.4%
Reasoning
39.9%
Knowledge
4.1
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Kimi

Kimi K2.6

#18
AA Intelligence Index 43 Composite capability score
Context window 256k Input capacity
Kimi K2.6 capability radar12%Intelligence28%Agentic55%Coding60%Science12%Reasoning13%Knowledge
Agentic
20.6%
Coding
53.5%
Science
91.1%
Reasoning
35.9%
Knowledge
6.4
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Anthropic

Claude Opus 4.7 (Non-reasoning, high)

#19
AA Intelligence Index 43* Composite capability score
Context window 1M Input capacity
Claude Opus 4.7 (Non-reasoning, high) capability radar12%Intelligence83%Agentic12%Coding12%Science12%Reasoning12%Knowledge
Agentic
28.9%
Coding
--
Science
--
Reasoning
--
Knowledge
--
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Xiaomi

MiMo-V2.5-Pro

#20
AA Intelligence Index 42 Composite capability score
Context window 1M Input capacity
MiMo-V2.5-Pro capability radar12%Intelligence12%Agentic33%Coding12%Science12%Reasoning12%Knowledge
Agentic
--
Coding
50.2%
Science
86.6%
Reasoning
33.8%
Knowledge
3.6
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Kimi

Kimi K2.7 Code

#21
AA Intelligence Index 42 Composite capability score
Context window 256k Input capacity
Kimi K2.7 Code capability radar12%Intelligence12%Agentic12%Coding12%Science12%Reasoning12%Knowledge
Agentic
--
Coding
--
Science
--
Reasoning
--
Knowledge
--
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Anthropic

Claude Sonnet 5 (Non-reasoning)

#22
AA Intelligence Index 42 Composite capability score
Context window 1M Input capacity
Claude Sonnet 5 (Non-reasoning) capability radar12%Intelligence79%Agentic55%Coding60%Science30%Reasoning36%Knowledge
Agentic
28.2%
Coding
53.6%
Science
91.1%
Reasoning
39.6%
Knowledge
15.3
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

Nex AGI

Nex-N2-Pro

#23
AA Intelligence Index 41 Composite capability score
Context window 262k Input capacity
Nex-N2-Pro capability radar12%Intelligence12%Agentic12%Coding12%Science12%Reasoning12%Knowledge
Agentic
--
Coding
--
Science
--
Reasoning
--
Knowledge
--
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

DeepSeek

DeepSeek V4 Pro (high)

#24
AA Intelligence Index 41* Composite capability score
Context window 1M Input capacity
DeepSeek V4 Pro (high) capability radar12%Intelligence63%Agentic31%Coding29%Science12%Reasoning12%Knowledge
Agentic
25.8%
Coding
50.0%
Science
88.8%
Reasoning
35.9%
Knowledge
--
Radar
AA benchmarks

Capability radar uses six Artificial Analysis benchmark families. Percent labels are normalized within this top-model set.

How to read these cards