跳到主内容
AI Toolset
AI Picker — 决策引擎,不是工具目录

付费前,选对 AI 工具。

· English

从实际任务出发,只比较真正符合你的工作流、预算和风险要求的少数工具。

大模型智能榜单

Artificial Analysis Intelligence Index

前沿模型到底谁更聪明?Artificial Analysis 将 GPQA Diamond、Humanity's Last Exam、Terminal-Bench 等 9 项独立评测加权汇总为一个智能指数,分数越高越强。

按 Artificial Analysis 智能指数排列的前 20 名模型;括号内为推理力度,条形自基线 20.1(非零)起算、按最高分归一化;标签数值为真实分数。数据快照: · 指数版本: v4.3.2. Artificial Analysis 方法论 · 查看完整模型榜单

组成评测与运行成本

来自 Artificial Analysis 的十三个榜单

既看构成智能指数的九项评测,也看单任务成本、API 定价与输出速度——这些取舍决定实际价值。除两张成本图外,数值越高越强。

GDPval-AA v2

基于真实表格与文档的定量分析。

Claude Opus 5.567.3%
Claude Fable 5.161.7%
Grok 4.759.8%
Muse Spark 1.358.7%
MiMo-V2.6-Pro58.7%
Qwen3.8 Max (0902)58.4%
GLM-5.357.3%
GLM 5.3 Flash57.0%
Grok 4.655.3%
DeepSeek V4.1 Flash55.0%

τ³-Banking

真实银行工作流中的 Agent 工具调用能力。

Grok 4.650.7%
Muse Spark 1.350.5%
GLM-5.350.3%
Qwen3.8 27B48.0%
Qwen3.8 Max (0902)47.8%
Claude Fable 5.147.2%
GLM 5.3 Flash47.2%
Kimi K346.0%
Gemini 3.8 Flash44.9%
GPT-6 Astra41.4%

SciCode

科学计算与科研代码问题。

Claude Opus 5.566.9%
Claude Fable 5.163.1%
MiMo-V2.6-Pro60.9%
Kimi K359.5%
GLM-5.359.0%
Step 5 Preview58.9%
Muse Spark 1.358.8%
GPT-6 Sol57.6%
Grok 4.757.4%
Gemini 3.8 Flash56.6%

Humanity's Last Exam

覆盖数十个领域的极高难度学术问答。

Claude Opus 5.561.4%
Claude Fable 5.159.1%
GPT-6 Astra54.7%
MiMo-V2.6-Pro49.4%
Muse Spark 1.348.7%
GPT-6 Sol47.9%
Gemini 3.8 Flash47.8%
Kimi K346.9%
Step 5 Preview46.5%
Grok 4.743.1%

GPQA Diamond

研究生水平科学问答(Diamond 子集)。

GPT-6 Astra96.1%
Gemini 3.8 Flash95.3%
Grok 4.694.9%
Claude Fable 5.193.7%
Muse Spark 1.393.5%
Kimi K393.5%
MiniMax-M392.9%
Qwen3.8 Max (0902)92.8%
GLM-5.391.7%
GLM 5.3 Flash91.2%

CritPt

模糊指令下的临界点推理能力。

Claude Opus 5.531.7%
GPT-6 Astra31.7%
GPT-6 Sol30.9%
GPT-5.5 Pro30.6%
Claude Fable 5.129.7%
MiMo-V2.6-Pro26.6%
Muse Spark 1.324.9%
Kimi K323.4%
Step 5 Preview20.9%
GPT-6 Luna19.4%

AA-LCR

长文档跨段落的上下文推理。

Kimi K388.7%
Step 5 Preview88.3%
MiMo-V2.6-Pro86.3%
Claude Fable 5.185.3%
Claude Opus 5.584.7%
DeepSeek V4.1 Flash84.0%
GPT-6 Sol83.7%
GPT-6 Luna83.3%
Muse Glimmer83.3%
Muse Spark 1.383.0%

Cost per Task

每个智能指数任务的综合美元成本,按 Token 类型拆分。

Muse Glimmer (high)$0.055
GPT-6 Luna (max)$0.068
Gemini 3.5 Flash-Lite$0.124
MiMo-V2.6-Pro$0.133
GLM-5.3-Flash$0.253
DeepSeek V4.1 Flash (max)$0.265
Mistral Medium 3.5$0.437
MiniMax-M3$0.508
Nemotron 3 Ultra$0.549
Inkling$0.607

Output Speed (tok/s)

模型 API 的输出速度(Token/秒,中位数)。

Gemini 3.5 Flash-Lite345
Gemini 3.8 Flash (high)288
DeepSeek V4.1 Flash (max)232
Muse Spark 1.3 (max)222
Inkling163
Mistral Medium 3.5149
MiniMax-M3145
GPT-6 Luna (max)132
Nemotron 3 Ultra121
GPT-6 Sol (max)104

所有图表:每张图取前 10 名模型,由 Artificial Analysis 独立测量;柱长已截断以突出差异,标签数值为真实分数。数据快照: . Artificial Analysis 方法论

LLM API 定价明细

API 定价:缓存命中、输入与输出

各模型官方牌价(美元/百万 Token),按三项之和从高到低排序。每个模型三根独立柱;所有柱共用同一比例尺,可跨模型直接比较。

Kimi K3 (max)
$0.300
$3.00
$15.00
GPT-6 Sol (max)
$0.200
$2.00
$10.00
Mistral Medium 3.5
$0.150
$1.50
$7.50
Grok 4.7 (xhigh)
$0.500
$2.00
$6.00
Grok 4.6 (high)
$0.500
$2.00
$6.00
Qwen3.8 Max (0902)
$0.250
$2.00
$6.00
GLM-5.3 (max)
$0.260
$1.40
$4.40
Muse Spark 1.3 (max)
$0.150
$1.25
$4.25
Inkling
$0.170
$1.00
$4.05
Gemini 3.8 Flash (high)
$0.075
$0.750
$3.75
Step 5 Preview
$0.050
$1.00
$2.70
Qwen3.8 27B (xhigh)
$0.100
$0.500
$3.00
Nemotron 3 Ultra
$0.160
$0.600
$2.50
Gemini 3.5 Flash-Lite
$0.030
$0.300
$2.50
Muse Glimmer (high)
$0.040
$0.350
$1.50
MiniMax-M3
$0.060
$0.300
$1.20
DeepSeek V4.1 Flash (max)
$0.006
$0.300
$1.20
MiMo-V2.6-Pro
$0.004
$0.435
$0.870
GLM-5.3-Flash
$0.026
$0.150
$0.500
GPT-6 Luna (max)
$0.010
$0.100
$0.500

牌价来自各模型 API,由 Artificial Analysis 整理发布。不支持提示缓存的模型没有缓存命中价。数据快照: .

交互式 AI Picker

按任务选择,不跟风

选择一个任务,获得实用的决策路径:先比较什么、哪些工具值得深入查看,以及付费前需要检查哪些风险与成本。

写作工作流

先从 Claude 或 ChatGPT 开始;只有确实需要专门的工作流功能时,再考虑写作类垂直工具。

对大多数写作任务,第一步不是挑某个写作应用,而是判断哪款 AI 助手能在预算内提供最好的起草、编辑与推理闭环。

编程工作流

先选交互方式:编辑器、扩展插件,还是终端 Agent。

以编辑器为核心工作流时,Cursor 更合适;终端和仓库级任务较多时,Claude Code 更匹配。套餐限制与团队控制通常比单纯的模型名称更重要。

研究工作流

检索阶段使用重视引用的工具,综合阶段再使用基于来源材料的工具。

Perplexity 适合带来源的探索;当你已经有文档并需要基于材料进行综合时,NotebookLM 更合适。

图像工作流

按输出质量、可控性与生产约束来选择。

Midjourney 是很强的创意质量标杆;Flux 适合模型与 API 工作流;当可控性和所有权很重要时,Stable Diffusion 生态更值得考虑。

视频工作流

先明确工作流:创意构思、短视频、编辑,还是生产素材。

视频工具价格较高且变化很快。先明确具体创作任务和所需输出格式,再决定是否订阅。

API 成本工作流

在扩大原型规模前先估算成本。

选定 API 提供商前,先检查输入/输出 Token 价格、免费额度、延迟预期与回退模型。

团队采购工作流

购买席位前,检查数据政策、管理控制、审计需求与实际使用情况。

适合团队的 AI 工具,通常需要同时具备可接受的风险控制、可预测的计费方式,以及成员真正愿意使用的工作流。

从任务出发

你想完成什么任务?

这些指南页是主要入口,每一页都会把庞杂市场缩小成一份实用候选清单。

付费前先对比

核心对比:把取舍讲清楚

当你已经确定品类、但还需要选择具体工具时,从这些页面开始。

核心工具档案

目前重点关注的十款核心工具

这些工具档案用于支撑指南与对比页;本站不会把所有长尾工具一视同仁地堆到用户面前。

定价与风险检查

做决定前,先检查成本与安全

选 AI 工具不只看功能;成本、限制、隐私与工作流适配同样重要。

开源趋势

追踪势头上升的 AI 项目

保持决策入口聚焦,同时保留通往 GitHub AI 热度的路径,便于发现快速上升的开源项目。