🤖 AI Toolset

📅 2026-07-10 · 约 11 分钟阅读

GPT-5.6 上线指南:Sol / Terra / Luna、定价、基准与谁该升级

GPT-5.6 不是单一模型,而是三档能力家族:Sol 冲顶、Terra 均衡日常、Luna 偏速度与成本。本指南把 OpenAI 发布数据整理成可执行的选型框架。

发布了什么

OpenAI 于 2026 年 7 月 9 日将 GPT-5.6 家族从有限预览推进到更广泛可用。家族包含旗舰 Sol、均衡低成本的 Terra,以及最快、最便宜的 Luna

命名很重要:数字标识代际,Sol / Terra / Luna 是可长期沿用的能力档。实务决策不再只是「要不要用 GPT-5.6」,而是哪一档更匹配任务难度、延迟与预算。

核心选型规则

日常均衡工作先从 Terra 起步;任务失败代价高或工作流确实很难时再上 Sol;规模、速度与成本压过极限推理深度时用 Luna。

可用性与定价

OpenAI 称 GPT-5.6 覆盖 ChatGPT、Codex 与 OpenAI API,并向全面可用逐步放量。API 上三档均可调用;Responses API 还增加了 Programmatic Tool Calling,以及可并发子 Agent 的 multi-agent beta。

模型输入 / 1M tokens输出 / 1M tokens首选场景
GPT-5.6 Sol$5$30难编程、长时 Agent、复杂专业任务
GPT-5.6 Terra$2.50$15日常工作、生产 Agent、成本敏感推理
GPT-5.6 Luna$1$6高吞吐、低延迟、偏经济型负载

GPT-5.6 及之后模型的 prompt caching 计费也有变化:cache 写入按未缓存输入价的 1.25× 计费,cache 读取仍保留约 90% 折扣。预算假设落地前请核对最新 API 文档。

基准要点

发布数据呈现的大致格局是:Sol 在多类 Agent、编程、浏览、电脑操控、安全与科学评测上领先或接近前沿;Terra 与 Luna 常以成本与速度换取部分峰值分数。

官方上线基准

GPT-5.6 精选分数

下列分数来自 OpenAI 上线页。只在同一基准与评测设置内比较。

基准SolTerraLunaGPT-5.5
Coding Agent Index v1.180.077.474.676.4
DeepSWE v1.172.7%69.6%67.2%67.0%
Terminal-Bench 2.188.8%87.4%84.7%85.6%
BrowseComp90.4%87.5%83.3%84.4%
OSWorld 2.062.6%50.2%45.6%47.5%
ExploitBench73.5%52.9%33.2%47.9%

重要限制:单张表不能证明「全面碾压」。部分上线表含在个别基准领先的竞品;不同 harness、推理设置、延迟与 token 预算都会改变排序。

编程与 Agent 工作

OpenAI 将 Sol 定位为迄今最强编程模型。Artificial Analysis Coding Agent Index v1.1 上 Sol 为 80,Terra 77.4,Luna 74.6;Terminal-Bench 2.1 上 Sol 88.8%,Terra 87.4%,Luna 84.7%。

更值得关注的产品变化可能在工作流:GPT-5.6 可用 Programmatic Tool Calling 编写并运行轻量程序来协调工具、处理中间结果并决定下一步。还引入了 max 推理,以及可并行协调多 Agent 的 ultra 模式。

何时用 Sol

实现失败、长调试循环或复杂 Agent 工作流的代价,高于模型溢价。

何时用 Terra

需要较强编程 Agent 表现,又要更紧地控制生产成本。

何时用 Luna

任务频繁、可并行,速度与体量比极限深度更重要。

知识工作与电脑操控

上线目标也不止编程。OpenAI 报告 Sol 在 BrowseComp 达 90.4%,OSWorld 2.0 达 62.6%。公司称 GPT-5.6 更擅长把文档与连接工作系统中的杂乱上下文,变成演示文稿、文档、表格与可交互产物。

对采购方而言,升级理由可能来自更少返工与更少工具往返,而不是某一个显眼基准。团队应衡量可接受产出、纠错时间、任务完成率与总成本——而不只是每 token 标价。

安全与科学

GPT-5.6 在多项安全与科学评测上提升明显。ExploitBench 上 Sol 为 73.5%,相对 GPT-5.5 的 47.9%;ExploitGym 在更长时限下 Sol 达 33.7%,相对 GPT-5.5 较短基线的 15.1%。上线页还报告 GeneBench Pro、LifeSciBench 与内部药物化学评测的提升。

能力变强也意味着治理要求更高。OpenAI 材料强调分层防护、监控、按信任与风险校准的访问,以及更新后的系统卡。高能力安全用途应配明确授权、范围、日志与复审。

谁该从 GPT-5.5 升级?

工作流先测哪档原因
难仓库级编程或终端 AgentSol家族内编程与终端分数最强。
通用专业工作与生产 AgentTerra能力与成本均衡,优先升级候选。
高吞吐摘要、路由、抽取或并行任务Luna标价最低、最快一档。
GPT-5.5 已稳定且无质量瓶颈先做可控试点不要只因「有新模型」就迁移;对比端到端成本与可接受产出。

对已在 GPT-5.5 上跑通的团队,正确迁移测试是代表性工作负载 A/B:在同一任务集上量完成率、重试、产出接受度、延迟、token 用量与审阅负担。

常见问题

GPT-5.6 是一个模型吗?

不是。它是含 Sol、Terra、Luna 能力档的家族。

API 里 GPT-5.6 多少钱?

OpenAI 标价:Sol 输入 $5 / 输出 $30(每 1M tokens),Terra $2.50/$15,Luna $1/$6。

GPT-5.6 在哪里可用?

官方称正在 ChatGPT、Codex 与 API 放量,具体套餐与功能随产品面变化。

是否人人都应立刻离开 GPT-5.5?

不必。按工作负载测对应档位,比较完整任务经济性,而不只看 token 价或头条基准。

主要来源:OpenAI 官方 GPT-5.6 上线页。文中基准与定价以该发布材料为准。