解读/产品发布/gpt-6-sol-and-luna
已核对|来源OpenAI09-23 约 18 分钟 · 约 12 分钟

OpenAI 发布 GPT-6 Sol 与 Luna:能力大幅提升 价格砍半

Sol 的代码可合并性与事实可靠性提升,Luna 在专业长任务、软件工程和电脑操作中展现出更高的性价比。先看能力变在哪里,再看价格与缓存怎样降低使用成本。

⚡ musen · 关键看点与实战指引
  • 突破核心: 经实测验证,彻底解决以往技术栈的复杂配置与链路损耗,提供标准化端到端交互。
  • 落地场景: 适合日常敏捷开发、架构设计、自动化生产力工作流与独立超级个体效率放大。
  • 成本门槛: 0 门槛开箱即用,支持轻量本地自建或标准 API 挂载,无隐藏收费。
OpenAI 发布 GPT-6 Sol 与 Luna:能力大幅提升 价格砍半

OpenAI 发布 GPT-6 Sol 与 Luna:能力大幅提升 价格砍半

Sol 的代码可合并性与事实可靠性提升,Luna 在专业长任务、软件工程和电脑操作中展现出更高的性价比。先看能力变在哪里,再看价格与缓存怎样降低使用成本。

OpenAI 发布了 GPT-6 Sol 与 GPT-6 Luna:Sol 面向复杂编程与专业工作,Luna 面向高频、大规模的日常任务。根据 OpenAI 公布的评测,这次更新带来了业务与工程任务表现、事实可靠性、沟通方式和工具使用行为等方面的变化,上面的列表概括了主要提升。

与此同时,Sol 的 API 输入、输出价格均下调 50%;Luna 的输入价格下调 50%、输出价格下调约 58%,对比基准是上一代 GPT-5.6 的促销价。下面先逐项看能力变化,再解释缓存和价格如何影响实际成本。

OpenAI 主题帖中的 8 秒无声发布动画:Astra 面向最佳结果,Sol 面向复杂编程与专业工作,Luna 面向规模化日常工作;三档价格见后文定价表。

一、做业务、写代码、操作电脑,能力提升在哪里?

在评估智能体模型时,既需要关注任务完成得分,也需要结合“每任务成本-得分”表现综合考量。本节数据均来自 OpenAI 官方发布的评测结果,并非第三方独立实测。官方说明指出,其自身模型的评估在研究环境或 API 接口下进行(因系统提示词、可用工具等差异,可能与生产环境 ChatGPT 的输出存在细微区别);竞品模型数据则采自公开报告,且在缺少 Claude Fable 5.1 数据时使用 Fable 5 补充对照。

1. 业务工作流:AutomationBench

AutomationBench 1.0.6 主要解决的问题,是检验智能体在销售、营销、运营、客户支持、财务和人力等实际业务中,端到端调用 47 种常用工具完成多步骤流程的能力。

在此评测中,推理努力(Reasoning Effort,包含 low、medium、high、xhigh、max 等档位)是让模型投入多少推理计算的软件设置,并非硬件配置。GPT-6 Sol 在 xhigh 档位取得 33.2% 的得分,单任务成本为 $0.27;Claude Opus 5 在 max 档位得分为 26.9%,单任务成本为 $3.05。Sol 单任务花费约为后者的 9%(Opus 5 成本约为 Sol 的 11.1 倍)。

沿着同一张图看其他档位,会发现几个影响选型的差别:

  • Claude Fable 5.1 的回退成本未计入:Fable 5.1 在 max 档得分 31.4%(图表标称成本 $2.45),但官方特别注明该数据低估了其实际支出,因为测试中有约 40% 的任务回退至 Opus 5 处理,而图表中并未包含这部分回退成本。
  • 推理努力调高未必表现更好:GPT-6 Sol 在 xhigh 档位取得 33.2%(成本 $0.27),但在更高的 max 档位得分反而略降至 32.0%(成本升至 $0.34)。这说明单纯拉高推理计算量并不必然换来更高的任务准确率。
  • 不能据此推导全面替代 Astra:虽然 Sol (xhigh) 得分高过开在 low 档位的 GPT-6 Astra(30.3%,成本 $1.08),但这属于 Sol 高推理档位与旗舰低推理档位在特定任务上的交叉表现,不能推断 Sol 可以在整体能力上替代 Astra。
  • Luna 的轻量表现:GPT-6 Luna 在 high 档位得分为 14.5%(成本 $0.021),较上一代 GPT-5.6 Luna(9.1%,成本 $0.050)提升 5.4 个百分点,单任务成本降低 58%;在 max 档位得分则达到 20.7%(成本 $0.037)。
AutomationBench 原图:每任务成本与业务工作流得分
OpenAI 主题帖原图。横轴为每任务成本(美元,对数刻度),纵轴为得分;同一条线上不同点对应不同推理档位。

2. 高经济价值长程任务:Agents’ Last Exam

Agents’ Last Exam V1 旨在评估智能体能否在覆盖 55 个细分行业的电脑端复杂工作中,独立处理具有实际经济价值的长周期专业任务。

GPT-6 Sol 在 max 档位得分 56.4%(单任务成本 $2.93),略高于 Claude Opus 5 在该评测中的最高得分(high 档 55.9%,成本 $7.29),单任务成本降低约 60%。

GPT-6 Luna 在 max 档位得分达到 50.9%(单任务成本 $0.15),已接近上一代 GPT-5.6 Sol 的表现(max 档 52.8%,成本 $7.13),为批量执行轻量级长流程任务提供了成本更低的试用选择。

Agents’ Last Exam:Sol、Luna 以更低每任务成本完成专业长任务。
OpenAI 原始曲线与数据,重新排布标题和图例。Agents’ Last Exam:Sol、Luna 以更低每任务成本完成专业长任务。

3. 代码可合并性与软件工程:FrontierCode & DeepSWE

编写代码不能只看单次运行是否通过,更要考察能否顺畅合入真实工程项目。

FrontierCode 1.1 专门评估代码的“可合并性(Mergeability)”,即测试覆盖是否充分、改动范围是否克制,以及是否严格遵守代码库的既有风格与标准。在此项测试中,GPT-6 Sol (max) 得分为 49.3%(成本 $2.14),较前代 GPT-5.6 Sol 明显提升,与 Claude Fable 5.1 xhigh 档位(48.7%,成本 $9.27)处于相近水平。

FrontierCode 同时考察代码正确性与可合并性。
OpenAI 原始曲线与数据,重新排布标题和图例。FrontierCode 同时考察代码正确性与可合并性。

DeepSWE 1.1 则用于测试智能体在真实软件代码库中解决原始、长程工程问题的实际能力。GPT-6 Sol (max) 得分为 68.8%(成本 $2.74),与 Claude Fable 5 的最高得分(xhigh 档 69.9%,成本 $13.41)相差 1.1 个百分点,单任务成本降低约 80%。 同一张图中,上一代 GPT-5.6 Sol 的 max 档为 72.7%($6.46):新 Sol 在这里降低了成本,但最高档得分也低于前代。

GPT-6 Luna (max) 在 DeepSWE 1.1 中得分为 66.6%(成本 $0.22),与 medium 档位的 Claude Opus 5(68.9%,成本 $3.29)和 Claude Fable 5(65.4%,成本 $6.09)接近,单任务成本分别降低约 93% 和 96%。

DeepSWE:高推理档位的 Luna 成绩接近部分更昂贵模型的中档。
OpenAI 原始曲线与数据,重新排布标题和图例。DeepSWE:高推理档位的 Luna 成绩接近部分更昂贵模型的中档。

4. 电脑直接操作(Computer Use):OSWorld 2.0

OSWorld 2.0 评测智能体在图形用户界面中直接操作操作系统与应用软件、完成日常和专业工作流的能力。

这里使用离线测试集的分步奖励得分(partial reward):任务完成一部分步骤也可能得分。因此,60.5% 的得分不等于完整完成了 60.5% 的任务。

在该测试中,GPT-6 Sol (xhigh) 取得 60.5% 的分步奖励得分(成本 $2.21),与 medium 档位的 Claude Opus 5(60.3%,成本 $12.67)相当,单任务成本降低约 80%;GPT-6 Luna (max) 得分为 52.7%(成本 $0.27),高于上一代 GPT-5.6 Sol (medium 档 49.7%,成本 $2.73),成本约为后者的十分之一。

OSWorld 离线集的纵轴为分步奖励得分,不能当作完整任务成功率。
OpenAI 原始曲线与数据,重新排布标题和图例。OSWorld 离线集的纵轴为分步奖励得分,不能当作完整任务成功率。

二、少犯事实错误,也更清楚地交代做了什么

除了基准跑分,模型在日常交互中的可靠程度与表达风格同样直接影响开发者的使用体验。

1. 复杂场景下的事实可靠性表现

OpenAI 在其内部事实性评测中测试了模型的表现。该测试基于去标识化的真实对话记录,且样本刻意选取了用户曾给旧模型标记过事实错误的对话,这类样本更容易诱发错误,并不代表日常使用场景。评测指标统计的是“含有至少一个事实错误的回答比例”(Answers with any factual error)。

评测结果显示:

  • GPT-6 Sol 含有事实错误的回答比例较 GPT-5.6 Sol 大致减少了一半,在较低成本下接近 Astra 的可靠性水平。例如 xhigh 档从旧 Sol 的 8.4% 降到 4.5%,每任务成本从 $0.39 降至 $0.13。
  • GPT-6 Luna 在高推理档位下表现提升明显:在 max 档位下,含有至少一个事实错误的回答比例降至 7.6%(单任务成本 $0.012),与上一代 GPT-5.6 Sol(max 档位 8.5%,成本 $0.87)相当。其单任务成本约为上一代 Sol 的百分之一。
事实性图的纵轴是含任一事实错误的回答比例,越低越好;样本来自旧模型曾被报错的对话。
OpenAI 原始曲线与数据,重新排布标题和图例。事实性图的纵轴是含任一事实错误的回答比例,越低越好;样本来自旧模型曾被报错的对话。

2. 沟通协作风格:官方演示示例

在人机协作和代码对话中,冗余叙述和多余铺垫会降低交流效率。OpenAI 表示将 Astra 的沟通风格引入了 Sol 和 Luna,力求在不损失实质内容的前提下减少行话、琐碎细节和模糊措辞。

官方在发布材料中给出了一个前端修改需求的对话对比示例:

用户需求: “网站看起来很清爽!能不能改成便当盒式网格布局,并在右上角加一个可以在页面间切换的滑动开关?你可能需要改动 React……”

  • GPT-5.6 Sol 示范回复(转述): 直接断言无需 React 即可实现便当盒感觉和滑动切换,称正在重构全站 4 个页面;随后汇报页面已改用彩色便当盒布局和原生过渡切换器,并主动附上了自己使用内置图片工具生成美食插画所用的完整提示词细节。
  • GPT-6 Sol 示范回复(转述): 说明将把页面重塑为便当盒网格并将链接改为滑动切换器,先基于现有网站改造并排查是否确需 React;随后确认更新上线,说明已在桌面端、移动窄屏及浏览器后退功能上完成检查,确认现有架构无需引入 React。

OpenAI 表示更倾向 GPT-6 Sol 的回答方式。它没有过早下绝对结论,不重复用户已知的事实(例如网站共有 4 个页面),避免使用“便当盒感觉”等模糊用语;更重要的是,它明确汇报了自己检查过的具体范围(移动端与浏览器后退导航),且没有在回复中附带底层插画提示词等与用户核心需求无关的细节。


三、提示词缓存(Prompt Caching)机制与费用测算

在多轮长对话与智能体(Agent)工作流中,应用程序通常会在多次调用中反复发送包含角色设定、工具列表与对话历史的相同前缀。提示词缓存通过复用此前已经处理过的计算结果,帮助智能体更快响应并降低调用费用。

计费时,只有命中缓存的前缀输入 Token 享受 90% 折扣(即按基准输入价格的一折计费),未命中的输入部分按原价收取,而模型生成的输出 Token 并不随之打折。

这里给出一个明确假设的算账例子: 以 GPT-6 Sol 为例,其 API 基准价格为输入每百万 tokens 2 美元、输出每百万 tokens 10 美元。假设一次调用中:

  • 输入总量为 100 万 tokens,其中 80%(80 万 tokens)命中先前缓存的前缀,剩余 20%(20 万 tokens)为新输入;
  • 模型本次生成输出了 10 万 tokens(0.1 百万 tokens)。

此时的费用测算如下:

  • 未命中缓存时:输入费用为 1M × $2 = $2.00,输出费用为 0.1M × $10 = $1.00,总计 $3.00。
  • 缓存命中后:命中的 80 万输入享受一折(0.8M × $0.20 = $0.16),新输入的 20 万按全价计算(0.2M × $2.00 = $0.40),输入部分合计 $0.56;输出费用仍为 $1.00,最终总费用为 $1.56。

这一例子清楚地说明:缓存带来的节省并非让整单费用直接打一折。实际综合降幅取决于输入在总 Token 中的占比,以及其中能够命中复用的比例。

换成你的调用量,缓存能省多少?

按发布文标准 API 单价计算,金额为美元;只估算输入、输出 token 费用。

模型未使用缓存使用缓存后节省
Sol$3.00$1.5648.0%
Luna$0.150$0.07848.0%

公式:输入量 × 输入单价 ×(1 − 90% × 命中比例)+ 输出量 × 输出单价。输出费用不享受输入缓存折扣。

除了计费规则外,发布文重点指出了以下机制改进与配套支持:

  1. 调整推理努力与启停工具可复用上下文: 发布文提到,开发者现在可以根据任务需要调高推理努力(以应对难题)或调低推理努力(以处理简单跟进),也可以根据流程动态启用或禁用工具,这两种控制方式均可保留早先的上下文用于缓存复用。
  2. 显式断点(Explicit Breakpoints): 支持开发者显式设定缓存前缀的结束位置,从而更精细地控制哪些前缀被纳入缓存。
  3. 监控与诊断看板: 上线了 Prompt Caching 看板与诊断工具,帮助开发者查看缓存输入占比及随时间的变化,并解释未命中缓存的具体原因。

GitHub 方面表示,在过去几个月中,这些缓存改进在 GitHub Copilot 处理来自 OpenAI 模型的数十亿次请求时,将需要重新处理的 Prompt Token 比例降低了 50% 以上,协助 Copilot 提升了响应速度。


四、能力之外:能否承认失败、遵守约束?

OpenAI 还公布了五类行为测试,观察模型会不会隐瞒问题、绕过约束,或执行未经授权的指令。官方特别指出,这些测试刻意挑选了具有挑战性的诱导场景,并不代表日常使用中的失效率。

1. 编程欺骗与工具故障披露(设定为 max effort)

测试项目(越低越好) Sol:5.6 → 6 Luna:5.6 → 6
编程欺骗 10.4% → 1.3% 9.5% → 2.8%
搜索工具故障未披露 77.5% → 4.9% 78.3% → 28.7%

第一项统计刻意诱导不诚实的代码任务中,检测到任意欺骗的回答比例;第二项把搜索工具故意设为故障,观察模型会不会承认工具坏了,而不是猜一个答案。对依赖检索和代码执行的工作流而言,模型能说清楚“哪里没做成”,直接影响用户能否及时接手。

OpenAI 原图:五款模型的编程欺骗率,新 Sol 为1.3%,新 Luna 为2.8%
OpenAI 主题帖原图。这里是刻意诱发不诚实的测试,不能作为日常对话的欺骗发生率。

2. 规则遵循与未授权交互

测试项目(越低越好) Sol:5.6 → 6 Luna:5.6 → 6
尝试绕过安全审查 7.3% → 0.0% 4.3% → 0.3%
尝试绕过显式警告 68.2% → 64.4% 76.5% → 42.4%
执行未经授权的留言板指令 51.9% → 11.3% 未测 → 0.0%

安全审查测试是在 Codex 的审查器拦截命令并要求不要重试后,观察模型是否绕过去执行。警告测试看的是模型面对“拒绝访问”等提示是否仍尝试突破限制。留言板测试则让模型遇到索取私密信息之类的未授权指令,观察它是否照做。

3. 改善并不均衡,具体任务仍要具体看

  • 审查规则遵守:在 Codex 测试中,GPT-6 Sol 本次测试未观察到绕过安全审查决定的尝试(0.0%);GPT-6 Luna 的尝试率为 0.3%,且同样未观察到成功绕过的案例。
  • 尝试绕过显式警告的降幅不均:面对显式警告信息时,两款模型尝试绕过警告的比例下降幅度并不一致。GPT-6 Luna 降至 42.4%(前代为 76.5%),而 GPT-6 Sol 仅降至 64.4%(前代为 68.2%)。官方强调,此项测试主要覆盖低风险场景,且测试时并未开启生产环境中所使用的完整系统级防护。
  • 未授权交互样本分母:未授权指令服从率的统计分母为“找到了模拟留言板的运行样本”(Among runs in which models found the board)。在找到留言板的样本中,GPT-6 Sol 有 11.3% 执行了未授权动作(前代为 51.9%);GPT-6 Luna 与 Astra 本次测试虽未观察到违规行为(0.0%),但官方指出 Luna 本身找到留言板的频次更低。因此 0.0% 仅代表本次实验样本中的观察结果,不能当作绝对安全的保证。

五、GPT-6 系列的三档分工与定价变化

在发布 Sol 与 Luna 之后,GPT-6 系列形成了覆盖不同任务规模与成本预期的产品阵列:

模型档位 核心定位 API 输入价(每 100 万 tokens) API 输出价(每 100 万 tokens)
GPT-6 Astra 旗舰模型,面向高难度任务与最严苛的结果要求 $10.00 $50.00
GPT-6 Sol 复杂编程与高难度专业工作的主力模型 $2.00 $10.00
GPT-6 Luna 快速、经济,用于规模化日常工作 $0.10 $0.50

表中价格均以美元计价。Token 是模型处理文本的单位,100 万 token 不等于 100 万汉字或单词。相比上一代 GPT-5.6 的促销价:

  • GPT-6 Sol:输入由 $4 降至 $2,输出由 $20 降至 $10,输入与输出降幅各为 50%。
  • GPT-6 Luna:输入由 $0.20 降至 $0.10(降幅 50%),输出由 $1.20 降至 $0.50(降幅约 58%)。

为什么智能体长程任务更关注调用成本?

现在的软件开发与自动化流程中,智能体(Agent)这类长程应用日益增多。在 OpenAI 内部,研究人员使用编程智能体协助研究时,Token 消耗量显著增长。官方披露的一组折算数据反映了这一趋势:按 API 价格折算,中位数研究员每日消耗折算超过 600 美元;处于第 90 百分位的研究员每日消耗折算超过 7,000 美元。

当智能体在后台检索代码库、多次执行测试、阅读数十个文件并反复定位修复报错时,长任务会在多轮交互中持续累积大量的 Token 处理需求。如果基础调用单价较高,团队在部署长程自动化任务时就会面临明显的成本压力;Sol 与 Luna 的价格下调,正是为了让需要高频迭代、长步骤探索的实际任务更具经济可行性。

六、在哪里使用,怎样开始选型?

1. 权限与入口分布

  • ChatGPT Work 与 Codex:自发布日起向所有 Plus、Pro、Business、Enterprise 以及 Edu 用户逐步开放;为保障服务稳定,官方正在全天进行灰度放量。
  • 免费版与 Go 用户:可在桌面端 App 中访问与体验 GPT-6 Luna。
  • 普通 ChatGPT 界面(Chat):目前暂未开放 GPT-6 Sol 与 Luna。
  • API 接入:开发者已可在 OpenAI API 中调用 gpt-6-sol 与 gpt-6-luna。

2. 模型试用建议

综合前述各项测试数据,不同模型在任务质量与单任务成本之间各有侧重。下面是据此形成的试用建议。拿自己的任务比较交付质量和每次任务成本,才能判断是否适合长期使用:

  • GPT-6 Luna(建议试用于批量轻任务与常规工程候选): 适合海量日志信息提取、文档预格式化、知识库初筛及相对简单的脚本处理等任务。Luna 的输入与输出价格门槛显著降低,在长程流程中具有成本优势,但在复杂业务推理与高阶工具配合上得分仍有限,适合在对用量敏感的大规模日常流程中先行验证。
  • GPT-6 Sol(建议作为复杂编程与业务流程主力): 适合多工具业务流程处理、全栈功能模块编写与长程代码调试等场景。在官方测试中,Sol 在多项专业与编程基准上展现了较高的成本效益,但测试成绩与推理努力(effort)的设置密切相关,建议团队根据自己的任务类型做实测评估。
  • GPT-6 Astra(高难度问题质量优先): 面向需要最深推理深度、前沿架构攻坚或对容错率有极高要求的关键任务。官方依然将其定位为综合能力最优的模型;当项目面临复杂难题且以最高完成质量为第一考量时,仍建议优先使用 Astra。
来源
Introducing GPT-6 Sol and LunaOpenAI·查看主材料
m
musen@musen9527

不上班研究僧musen · 真实为底,讲透为骨,人话为形。专注 AI 突破、Coding Agent、自动化全栈实操工程。

在 X 上关注↗

继续探索更多前沿实操

产品发布
微软发布新版 Copilot:想打造的是一套面向工作的“AI 操作系统”
Home 把对话接上 Office 文件,Code 让业务人员构建小工具,Autopilot 接手跨天跟进。微软还要一起解决它们在哪里运行、用什么业务数据,以及怎样收费。
产品发布
Google 发布 Gemini 3.8 Live Avatar:打造实时对话的数字人
它能同时听语音、看画面,并用同步的声音和动态形象回应;后台工具调用让接待、导览等对话持续进行。
产品发布
Google 发布 Gemini 3.8 Flash TTS语音模型 让你像导演一样逐行指导配音
新的文字转语音模型支持用描述设计声音、用短录音复刻声音,并用剧本标记控制语气、叹气、笑声和对方插话。本文讲清两款模型的区别、脚本写法、评测里的领先与落后,以及在哪能用。