📅 2026-07-09 · 约 12 分钟阅读
GPT-5.6 发布指南:Sol vs Terra vs Luna、定价、基准与可用性
GPT-5.6 是覆盖旗舰推理、均衡日常与低成本高吞吐的三档模型家族。本指南把 OpenAI 发布数据整理成可落地的选型决策。
发布了什么
OpenAI 将 GPT-5.6 发布为三档模型家族,而非一个万能模型。Sol 是最难推理与 Agent 工作的旗舰档;Terra 定位为更低成本的日常均衡模型;Luna 是面向高吞吐的最快、最省档。
这次发布同时覆盖消费、编程与开发者工作流。官方称 GPT-5.6 可在 ChatGPT、ChatGPT Work、Codex 与 OpenAI API 使用,具体取决于套餐、产品面与放量节奏。
可用性
官方称 GPT-5.6 在 ChatGPT、Codex 与 API 全球起步放量,并逐步走向全面可用。不同产品面的访问权不同。
- Chat:Plus、Pro、Business、Enterprise 可通过中等及以上力度使用 GPT-5.6 Sol;Pro 与 Enterprise 还可选 Sol Pro 处理最复杂任务。
- ChatGPT Work 与 Codex:Free 与 Go 可用 Terra;Plus 及以上可在 Sol / Terra / Luna 间选择并设置力度。官方称这些产品面上有 GPT-5.6 访问权的用户可用
max,而ultra套餐范围更窄。 - API:开发者可调用 Sol、Terra、Luna;并引入 Programmatic Tool Calling 与可并发子 Agent 再汇总的 multi-agent beta。
放量与套餐权益会变。把生产工作流绑定到特定访问假设前,请核对官方产品与定价页。
GPT-5.6 定价
OpenAI 公布的 API 价(每 100 万 tokens)如下。
| 模型 | 输入 / 1M | 输出 / 1M | 首选适配 |
|---|---|---|---|
| GPT-5.6 Sol | $5 | $30 | 难推理、编程 Agent、长时专业工作流 |
| GPT-5.6 Terra | $2.50 | $15 | 日常工作、规模化 Agent、成本敏感质量 |
| GPT-5.6 Luna | $1 | $6 | 快、高吞吐,延迟与成本主导 |
GPT-5.6 还改变了 prompt caching 经济性:cache 写入按未缓存输入价 1.25× 计费,cache 读取仍有约 90% 折扣。对重复长上下文工作流,缓存设计本身就是成本建模的一部分。
Sol vs Terra vs Luna:先测哪档?
实务决策矩阵
先看工作流经济性,再在代表性任务上测质量。
| 负载 | 先测 | 原因 |
|---|---|---|
| 复杂仓库实现 | Sol | 家族内编程与长程 Agent 能力最强。 |
| 日常分析与生产 Agent | Terra | 价更低,若干上线对比仍接近或高于 GPT-5.5。 |
| 分类、路由、抽取、快速辅助 | Luna | 吞吐优先时最低价、最快档。 |
| 极难多工作流任务 | Sol + max 或 ultra | 更高推理力度与并行 Agent 可改善分数-延迟权衡,但 token 更高。 |
基准上下文
OpenAI 发布了覆盖专业工作、编程、科学、电脑操控、安全、自改进、多模态、学术、工具使用、长上下文与抽象推理的宽表。关键教训不是某一模型赢每一行:GPT-5.6 在 Agent、电脑操控、编程与效率相关处最强,竞品排序随基准变化。
专业与 Agent
- Agents' Last Exam:Sol 52.7%,Terra 50.4%,Luna 50.3%
- Intelligence Index v4.1:Sol 58.9,Terra 55,Luna 51.2
- Big Finance Bench:Sol 53%,Terra 51%,Luna 36%
编程与终端
- Coding Agent Index:Sol 80,Terra 77.4,Luna 74.6
- DeepSWE v1.1:Sol 72.7%,Terra 69.6%,Luna 67.2%
- Terminal-Bench 2.1:Sol 88.8%,Sol Ultra 91.9%,Terra 87.4%,Luna 84.7%
电脑操控
- OSWorld 2.0:Sol 62.6%,Terra 50.2%,Luna 45.6%
- BrowseComp:Sol 90.4%,Sol Ultra 92.2%,Terra 87.5%,Luna 83.3%
- BenchCAD:Sol 70.6%,Terra 62.3%,Luna 63.1%
安全
- Capture-the-Flag:Sol 96.7%,Terra 91.8%,Luna 85.2%
- SEC-Bench Pro:Sol 71.2%,Sol Ultra 74.3%,Terra 57.7%,Luna 48.9%
- ExploitBench:Sol 73.5%,Terra 52.9%,Luna 33.2%
官方表也有重要「非全胜」。例如 GPT-5.6 Sol 的 SWE-Bench Pro 为 64.6%,低于同表若干 Claude 结果。基准决策应保持任务特定,不要压成一张万能排行榜。
编程与 Agent 工作流
GPT-5.6 最务实的故事是更强 Agent 能力与更好效率的组合。OpenAI 强调 Terminal-Bench 2.1 与多 Agent 设置;早期合作方也报告生产工作流上更少 token、更低延迟、更少步骤与工具调用。
对编程团队,评测应超过基准分:跑一个仓库任务,跟踪可接受改动、测试通过率、重试、工具调用、总 token 与审阅负担。最难任务可能 Sol 胜出,但若 Terra 能以明显更低成本达到可接受质量,它更适合做默认。
知识工作、设计与电脑操控
OpenAI 将 GPT-5.6 定位为文档、演示、表格、浏览与电脑操控的更强端到端操作者。上线页报告 Sol 在 BrowseComp 90.4%、OSWorld 2.0 62.6%,Ultra 在 BrowseComp 达 92.2%。
实务含义是:选型测试应包含最终产物,而不只是中间文本。对演示、表格、仪表盘与前端,检查版式质量、完整度、是否遵循参考文件,以及可用前需要多少轮修正。
安全与攻防
OpenAI 称 GPT-5.6 以迄今最强防护上线,且在生物与网络安全方面仍低于公司 Critical 能力阈值。上线页强调防御用途:安全代码审查、补丁、漏洞分诊、威胁建模、恶意软件分析与检测工程。
攻防基准提升显著:ExploitBench 上 Sol 73.5% 对 GPT-5.5 的 47.9%;SEC-Bench Pro 上 Sol 71.2% 对 45.8%。这些结果应与访问控制、防护措施与预期防御工作流一起阅读。
谁该用哪档 GPT-5.6?
- 先选 Sol:难编程 Agent、长时研究、复杂电脑操控、高要求专业分析,以及失败代价昂贵的任务。
- 先选 Terra:广泛日常工作、规模化 Agent 舰队、知识工作,以及想先拿到更好性价比、再为极限能力付费的团队。
- 先选 Luna:高吞吐抽取、分类、路由、快速辅助,以及最低成本主导的延迟敏感工作流。
- 有选择地测 max / ultra:任务确实难到值得更多推理或并行 Agent 时。不要在未衡量增量价值前把最贵设置当默认。
对多数团队,较好的上线方式是分层路由:简单工作用 Luna,默认用 Terra,升级用 Sol。这是从官方能力与定价档推断的建议,不是声称一种路由策略适配所有负载。
主要来源:OpenAI 官方 GPT-5.6 上线页。基准与定价复述自官方发布数据;评测方法不同,应在各自上下文中解读。
常见问题
GPT-5.6 是一个模型吗?
不是。OpenAI 将其呈现为含 Sol、Terra、Luna 的能力档家族,价格与性能定位不同。
ChatGPT 里能用 GPT-5.6 吗?
可以。官方称正在 ChatGPT、ChatGPT Work、Codex 与 API 放量,模型访问取决于套餐与产品面。
哪档 GPT-5.6 最便宜?
Luna 标价最低:输入 $1 / 输出 $6(每 100 万 tokens)。
GPT-5.6 是否赢下所有编程基准?
没有。官方表显示 Terminal-Bench 与 DeepSWE 很强,但如 SWE-Bench Pro 等基准上排序会变。
相关阅读: