📅 2026-07-10 · 约 11 分钟阅读
GPT-5.6 上线指南:Sol / Terra / Luna、定价、基准与谁该升级
GPT-5.6 不是单一模型,而是三档能力家族:Sol 冲顶、Terra 均衡日常、Luna 偏速度与成本。本指南把 OpenAI 发布数据整理成可执行的选型框架。
发布了什么
OpenAI 于 2026 年 7 月 9 日将 GPT-5.6 家族从有限预览推进到更广泛可用。家族包含旗舰 Sol、均衡低成本的 Terra,以及最快、最便宜的 Luna。
命名很重要:数字标识代际,Sol / Terra / Luna 是可长期沿用的能力档。实务决策不再只是「要不要用 GPT-5.6」,而是哪一档更匹配任务难度、延迟与预算。
核心选型规则
日常均衡工作先从 Terra 起步;任务失败代价高或工作流确实很难时再上 Sol;规模、速度与成本压过极限推理深度时用 Luna。
可用性与定价
OpenAI 称 GPT-5.6 覆盖 ChatGPT、Codex 与 OpenAI API,并向全面可用逐步放量。API 上三档均可调用;Responses API 还增加了 Programmatic Tool Calling,以及可并发子 Agent 的 multi-agent beta。
| 模型 | 输入 / 1M tokens | 输出 / 1M tokens | 首选场景 |
|---|---|---|---|
| GPT-5.6 Sol | $5 | $30 | 难编程、长时 Agent、复杂专业任务 |
| GPT-5.6 Terra | $2.50 | $15 | 日常工作、生产 Agent、成本敏感推理 |
| GPT-5.6 Luna | $1 | $6 | 高吞吐、低延迟、偏经济型负载 |
GPT-5.6 及之后模型的 prompt caching 计费也有变化:cache 写入按未缓存输入价的 1.25× 计费,cache 读取仍保留约 90% 折扣。预算假设落地前请核对最新 API 文档。
基准要点
发布数据呈现的大致格局是:Sol 在多类 Agent、编程、浏览、电脑操控、安全与科学评测上领先或接近前沿;Terra 与 Luna 常以成本与速度换取部分峰值分数。
官方上线基准
GPT-5.6 精选分数
下列分数来自 OpenAI 上线页。只在同一基准与评测设置内比较。
| 基准 | Sol | Terra | Luna | GPT-5.5 |
|---|---|---|---|---|
| Coding Agent Index v1.1 | 80.0 | 77.4 | 74.6 | 76.4 |
| DeepSWE v1.1 | 72.7% | 69.6% | 67.2% | 67.0% |
| Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% | 85.6% |
| BrowseComp | 90.4% | 87.5% | 83.3% | 84.4% |
| OSWorld 2.0 | 62.6% | 50.2% | 45.6% | 47.5% |
| ExploitBench | 73.5% | 52.9% | 33.2% | 47.9% |
重要限制:单张表不能证明「全面碾压」。部分上线表含在个别基准领先的竞品;不同 harness、推理设置、延迟与 token 预算都会改变排序。
编程与 Agent 工作
OpenAI 将 Sol 定位为迄今最强编程模型。Artificial Analysis Coding Agent Index v1.1 上 Sol 为 80,Terra 77.4,Luna 74.6;Terminal-Bench 2.1 上 Sol 88.8%,Terra 87.4%,Luna 84.7%。
更值得关注的产品变化可能在工作流:GPT-5.6 可用 Programmatic Tool Calling 编写并运行轻量程序来协调工具、处理中间结果并决定下一步。还引入了 max 推理,以及可并行协调多 Agent 的 ultra 模式。
何时用 Sol
实现失败、长调试循环或复杂 Agent 工作流的代价,高于模型溢价。
何时用 Terra
需要较强编程 Agent 表现,又要更紧地控制生产成本。
何时用 Luna
任务频繁、可并行,速度与体量比极限深度更重要。
知识工作与电脑操控
上线目标也不止编程。OpenAI 报告 Sol 在 BrowseComp 达 90.4%,OSWorld 2.0 达 62.6%。公司称 GPT-5.6 更擅长把文档与连接工作系统中的杂乱上下文,变成演示文稿、文档、表格与可交互产物。
对采购方而言,升级理由可能来自更少返工与更少工具往返,而不是某一个显眼基准。团队应衡量可接受产出、纠错时间、任务完成率与总成本——而不只是每 token 标价。
安全与科学
GPT-5.6 在多项安全与科学评测上提升明显。ExploitBench 上 Sol 为 73.5%,相对 GPT-5.5 的 47.9%;ExploitGym 在更长时限下 Sol 达 33.7%,相对 GPT-5.5 较短基线的 15.1%。上线页还报告 GeneBench Pro、LifeSciBench 与内部药物化学评测的提升。
能力变强也意味着治理要求更高。OpenAI 材料强调分层防护、监控、按信任与风险校准的访问,以及更新后的系统卡。高能力安全用途应配明确授权、范围、日志与复审。
谁该从 GPT-5.5 升级?
| 工作流 | 先测哪档 | 原因 |
|---|---|---|
| 难仓库级编程或终端 Agent | Sol | 家族内编程与终端分数最强。 |
| 通用专业工作与生产 Agent | Terra | 能力与成本均衡,优先升级候选。 |
| 高吞吐摘要、路由、抽取或并行任务 | Luna | 标价最低、最快一档。 |
| GPT-5.5 已稳定且无质量瓶颈 | 先做可控试点 | 不要只因「有新模型」就迁移;对比端到端成本与可接受产出。 |
对已在 GPT-5.5 上跑通的团队,正确迁移测试是代表性工作负载 A/B:在同一任务集上量完成率、重试、产出接受度、延迟、token 用量与审阅负担。
常见问题
GPT-5.6 是一个模型吗?
不是。它是含 Sol、Terra、Luna 能力档的家族。
API 里 GPT-5.6 多少钱?
OpenAI 标价:Sol 输入 $5 / 输出 $30(每 1M tokens),Terra $2.50/$15,Luna $1/$6。
GPT-5.6 在哪里可用?
官方称正在 ChatGPT、Codex 与 API 放量,具体套餐与功能随产品面变化。
是否人人都应立刻离开 GPT-5.5?
不必。按工作负载测对应档位,比较完整任务经济性,而不只看 token 价或头条基准。
主要来源:OpenAI 官方 GPT-5.6 上线页。文中基准与定价以该发布材料为准。
相关阅读: