解读/产品发布/claude-opus-5-5
已核对|来源Anthropic09-23 约 16 分钟 · 约 12 分钟

Claude Opus 5.5 发布:编程、视觉与写作大幅升级,多项基准超越 Fable 5.1,价格却大幅降低|看这些实战案例

结合官方图表、X 视频和 Every 的一周实测,看它解决了哪些老问题,做出的作品与日常使用又是什么样。

⚡ musen · 关键看点与实战指引
  • 突破核心: 经实测验证,彻底解决以往技术栈的复杂配置与链路损耗,提供标准化端到端交互。
  • 落地场景: 适合日常敏捷开发、架构设计、自动化生产力工作流与独立超级个体效率放大。
  • 成本门槛: 0 门槛开箱即用,支持轻量本地自建或标准 API 挂载,无隐藏收费。
Claude Opus 5.5 发布:编程、视觉与写作大幅升级,多项基准超越 Fable 5.1,价格却大幅降低|看这些实战案例

Claude Opus 5.5 发布:编程、视觉与写作大幅升级,多项基准超越 Fable 5.1,价格却大幅降低|看这些实战案例

结合官方图表、X 视频和 Every 的一周实测,看它解决了哪些老问题,做出的作品与日常使用又是什么样。

Anthropic 发布了 Claude Opus 5.5。这次升级覆盖复杂编程、视觉与交互、知识工作,以及一直被吐槽的写作体验。在 Anthropic 的评测中,它的 Terminal-Bench 得分 66.4%,高于 Fable 5.1 的 55.8%;CursorBench 为 57.8% 对 51.8%。在代码库里连续解决问题,和在一段提示词后做出完整作品,是它最值得看的两种能力。

价格也改变了选择:Opus 5.5 的 API 输入、输出单价分别是每百万 Token 4 美元和 20 美元,比 Fable 5.1 的 10 美元和 50 美元都低 60%。与上一代 Opus 5 相比,Anthropic 称典型任务费用约低 40%,输出速度快 30% 以上。

这些升级在日常工作里,分别表现为:

  • 编程:更适合连续推进整项任务。 跨文件修改和长时间工程任务更稳;CursorBench 的默认 medium 档已超过 Fable 5.1 的最高档。一般任务可以先从 medium 开始。
  • 视觉与交互:从“做个页面”走向更完整的作品。 水下探索游戏、手绘动画、可调投石机和积木搭建工具,把画面、操作和反馈连成了完整体验。
  • 知识工作:更好地检索、整理和交付复杂资料。 财报查证、并购建模和跨应用操作的表现都有提升;另一项专业工作测试达到 1846 Elo,高于 Fable 5.1 的 1735。
  • 写作:少绕弯,先说重要信息,更愿意遵守你的表达规则。 新版更愿意听反馈,少用套话;写文档和解释问题时,重要信息也更早出现。
Anthropic 的 Opus 5.5 品牌发布短片。官方原帖

写作升级:少一点套话,先把事情讲明白

Opus 5 的“AI 味”曾是高频吐槽:回答先铺背景、爱堆术语和套话,关键结论埋在后面;请它改两句,有时又忙着解释、争辩自己原来的写法。Every 的试用者说,旧版的解释常常“还需要再解释一遍”。写文档或长期协作时,这会让人把时间花在追问和改稿上。

Opus 5.5 主要改的是这种沟通体验。 Anthropic 称它会把重要信息放在前面,减少拗口的表达,更愿意遵守用户给的写作规则。官方账单排错示例让这个变化很容易看出来:新版先告诉你钱差在哪里,然后再讲代码出了什么问题。

同样找对 Bug,新版先说影响

两款模型都找到了同一个账单错误:代码把月末截止时间设成“最后一天的零点”,漏算了那一整天的用量。

区别在展开顺序。Opus 5 先指出是哪次提交引入问题,然后展示代码、解释时间区间,接着说明漏计影响及测试为什么没有发现它。Opus 5.5 一开始就交代:账单下降中,1.50 美元来自免费层调整,另外 9.92 美元来自 Bug;后者导致月末最后一天的用量没有计费。读者先知道影响多大,再读代码了解原因。

Opus 5与5.5解释同一账单Bug的官方并排截图
左为 Opus 5,右为 Opus 5.5。两者都定位到错误,新版更早交代金额和漏计后果。官方写作对照

官方还展示了两组对照。总结 Slack 讨论时,两款模型都用了三条清单,新版把“问题、立即措施、长期方案”中的责任人和完成状态写得更容易跟进。解释国际象棋程序时,新版围绕“两个格子中间有没有棋子挡住”说明设计:用掩码记录中间格,再计算阻挡数量;数量为零,攻击才成立。它把技术细节连回了读者要理解的问题。

写得更自然,长文仍可能绕远

早期测试者 Theo Jaffee 用同一个提示词——“explain how options work”——展示了两款模型的回答。他认为 Opus 5.5 的写作更直接、自然,减少了让人出戏的套话。这条帖子在检索时约有 1300 赞。

旧版先从“未来交易”和核心思想谈起,再列定义、类型及较长的算例。新版首段直接给出定义和权利金,随后将类型、术语、上涨与下跌情形、盈亏平衡点分开。区别在阅读顺序:先弄懂期权是什么,再看分类和算例。

Theo发布的Opus 5回答截图:解释期权原理
Theo 标注的 Opus 5 回答:先铺陈概念,再进入定义与长段算例。
同提示词下Opus 5.5的回答截图
Theo 标注的 Opus 5.5 回答:定义、分类和算例中的不同情形更容易逐项阅读。

企业反馈也更接近日常写作任务。Ramp 工程师 John Ruelas 表示,新版更能遵守团队写作规则,设计文档只需很少修改;重写的一条提示词甚至比他的原版更合意。Box 的 Yashodha Bhavnani 则称,在其评测中,Opus 5.5 使用的 Token 约为 Opus 5 的三分之一,回答冗长程度减少约 40%,同时保持准确性。

科技媒体 Every 的实测更看重协作体验变顺了:新版愿意接受修改意见,顺着给定材料继续创作,也更能解释取舍。

Every 测得的英文 Flesch-Kincaid 年级值为 6.95,低于 Opus 5 的 7.97 和 Fable 5.1 的 7.43,约对应美国七年级阅读难度;Reading Ease 易读分为 68.4。这项评分衡量英文词句是否容易阅读。

Every测得的各模型英文可读性评分对比表
Every / Daniel Rodrigues 的英文可读性表。Opus 5.5 比 Opus 5 更易读;图中 Grok 的两项分数还略好一些。

写作仍有一个明显短板:话更好懂,重点却未必更早出现。Every 的文章开头测试中,新版用了 37—39 句表达作者 21 句的内容;Dan Shipper 也发现,它能找出最有意思的观点,却没有把它放在开头。

这让 Opus 5.5 更适合一起讨论想法、扩充初稿;定稿时仍要检查第一段有没有直接说出核心观点。写作升级已经能从配合度和表达中感受到,精炼与取舍还需要编辑。

X 上的演示:游戏、动画与视觉完成度

X 上的开发者和 Anthropic 团队很快放出了可看的作品。游戏与动画最适合观察这次升级:它有没有把场景、操作和反馈真正做出来?

水下探索游戏:场景、任务和反馈连成了一次体验

Anthropic 团队成员 Edwin Arbus 的演示约有 1315 赞。他让 Opus 5.5 制作一款受安提基特拉机械启发的游戏,并称整个作品是一个约 3 MB 的 HTML 文件,通过 Three.js 在浏览器内运行,画面与声音均由代码实时生成。

视频先展示航船与潜水员,随后进入水下:鱼群、海草与光束形成环境;“寻找三枚青铜碎片”的目标、空气倒计时和声呐形成任务;找到机关后出现齿轮装置与完成画面。这组演示的价值在于,不同视觉与交互元素围绕同一探索目标组织起来了。

Edwin 的水下探索游戏,60 秒。Anthropic 团队成员作品。作者提供的可玩作品

丧尸游戏对照:同题作品的画面差异

第三方评测账号 BridgeBench 发布的对照约有 653 赞。作者称两款模型使用了相同提示词,讲解中明确标注先展示 Opus 5.5,后展示 GPT-6 Sol。

前半段是较写实的城市射击场景:路面反光、建筑层次、枪械和界面元素较丰富;后半段则是更简化的方块角色与规则化场地。同一条演示里,两种作品的场景密度、画面风格和交互界面差别很直观。

BridgeBench 的 79 秒对照,配有中文讲解字幕;约 38 秒后切换至 GPT-6 Sol。

手绘动画:借助既有技能控制风格与转场

开发者 superalesha 的动画约有 478 赞。他要求 Opus 5.5 表现 Claude 模型的发展过程,并说明使用了自己的 hand-drawn-canvas-animation 技能,作品以纯 JavaScript 制作。

视频从铅笔、纸张和星芒标识出发,经过翻页、怀表齿轮、蓝图桥梁、风暴和色彩转场,最后落到一句问候。它展示了如何把统一画风维持到多段场景中。

superalesha 的手绘动画,约 87 秒;作者披露使用自编技能配合 Opus 5.5。

官方的八个作品,把能力展示得更具体

Anthropic 还发布了一条早期探索合集。其中既有连续叙事的动画,也有能接受输入、给出反馈的应用原型。

连续叙事与数据重建

西瓜故事由 Kevin Ngo 制作。蚂蚁从搬运、种植到经历风暴、收获分享,形成了一段约 29 秒的手绘故事。它展示的是连续场景的表达,而不只是一张插画。

Kevin Ngo 的西瓜故事:蚂蚁搬运、种植、经历风暴,最后分享收成。

Earthrise 重建则利用图像线索和公开数据,复现阿波罗 8 号拍摄“地出”照片的时刻。演示从原照片出发,展示地平线边缘、位置、镜头拟合、光照与胶片响应等环节,再呈现重建画面。它把图像观察、资料与几何关系串进同一个可视化过程。

官方探索 2:从图像与公开数据重建 Earthrise。演示从照片线索走到几何与光照重建。

把草图和视觉想法变成可操作界面

Kevin Ngo 的 Penpal 把 Claude Code 做成了纸笔风格界面:新会话是一张餐巾纸,项目列表、继续上次会话和用量都保留了具体操作入口。它在风格变化之后,仍然围绕原本的工作组织界面。

Penpal纸笔风格Claude Code界面,包含项目列表、新建会话和用量
官方探索 3:Kevin Ngo 的餐巾纸界面,新建会话、继续任务和项目导航融入纸笔风格。

投石机从铅笔草图变成桌面上的三维模型。演示者可以拉动投掷臂、调整配重,看弹丸飞行并撞倒方块。这里不只有物体造型,还有“改变参数—观察结果”的交互关系。

官方探索 4:草图变成可调投石机模拟,可见弹道和碰撞反馈。

Tyler Nishida 的 UI 老虎机随机组合界面元素,为新应用提供起点。另一件作品来自 thedesignely:围绕甲虫海报做出视觉特效控制器,调整参数时,预览随之改变纹理和形变。前者帮助产生组合,后者帮助比较变化后的效果。

官方探索 5:Tyler Nishida 的 UI 随机组合工具。
官方探索 6:thedesignely 的视觉特效作品,参数与预览联动。

生成之后,还能继续修改与复用

积木搭建应用接受照片或文字描述,输出三维积木模型及搭建说明。视频里能看到修改描述后的城堡、逐层步骤和零件指引:它尝试把“看起来像一个模型”推进到“告诉人如何搭起来”。

官方探索 7:照片或描述转成积木模型,并提供逐步搭建说明。

Kevin Ngo 的 算法绘图程序则让同一套画风产生不同构图。官方说每幅画使用不同的随机种子;展示图中,海浪、岛屿和日落的位置不断变化,铅笔笔触和纸张质感保持一致。对于需要成组视觉素材的工作,这比只能输出一个固定结果更有复用价值。

18幅风格一致、构图不同的算法海景绘画
官方探索 8:Kevin Ngo 的算法绘图,每幅对应不同种子。

编程究竟提升多少:默认档位已经很有竞争力

视觉演示之外,官方基准提供了另一种观察。下图涵盖编程、知识工作、电脑操作和图表识别。其中 OSWorld 采用 partial 计分,Chartography 在使用工具的条件下从 Opus 5 的 83.4% 提升到 89.0%。

Opus 5.5与Fable5.1、Opus5、GPT6 Astra及GPT5.6 Sol的完整官方评测矩阵
官方完整评测矩阵。默认采用 max;Terminal-Bench 的 Opus 5.5 为 xhigh、Astra 为 high。

“effort”可以理解为模型分配给思考的预算。更高档通常意味着花更多时间和费用,但不保证每项任务都得分更高。Opus 5.5 的一个变化,是默认 medium 已经能完成很多此前需要高档模型处理的工作。

  • Terminal-Bench 4.0 考察终端中的多步执行与问题解决。Opus 5.5 的 xhigh 得分为 66.4%,Opus 5 为 52.3%,Fable 5.1 为 55.8%,Astra 为 57.9%。medium 约为 58%,按官方比较,费用约为 Opus 5 max 的五分之一,也只需 Astra 同等表现约 40% 的费用。
  • FrontierCode v1.1 除了正确性,还关心修改能否达到代码库的合入标准。Opus 5.5 medium 得分 54.6%,max 为 54.4%;medium 以约 Astra 五分之一的任务费用,超过其 53.3% 的成绩。对这类任务,拉满预算不一定划算。
  • CursorBench 4.0 来自真实用户的复杂跨文件任务。medium 得分 52.5%,已超过 Fable 5.1 max 的 51.8% 和 Opus 5 max 的 46.6%;相对 GPT-5.6 Sol 的 41.7%,费用约为其三分之一。Opus 5.5 max 得分进一步达到 57.8%,但费用也增加。
Terminal-Bench不同思考档位的得分与费用曲线
Terminal-Bench:medium 约 58%,high 约 64%,xhigh 66.4%;Opus 5.5 的标准误差为 ±2.6 个百分点。
FrontierCode不同思考档位的表现与费用
FrontierCode:medium 与 max 成绩接近,费用差距明显。横轴为每任务美元,对数刻度。
CursorBench默认与最高思考档位的得分成本对比
CursorBench:默认档 52.5%,最高档 57.8%;增益与成本需要一起看。

长任务反馈更接近工程现场。Anthropic 内部让模型将 HAProxy 从 C 改写为 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 为 12 小时;两者几乎通过全部回归测试,而 Opus 5.5 的费用低 51%。公告还收录了早期测试者不到一天完成 68 万行代码迁移、不到 3 小时审计修复 20 万行遗留代码的案例。

Stripe 工程师 Cristian Rivera 描述的是另一种难题:40 个层叠 PR 的复杂变基。一个 Opus 5.5 会话协调十几个会话,把冲突解释清楚;到第二天下午,40 个 PR 都通过了 CI。Clio 的 Sean Heintz 则报告,模型在跨六个仓库的任务中持续运行超过 18 小时,推进里程碑更快、返工较少。这里的进步既包括继续做事,也包括让人离开一段时间后能重新看懂进展。

Every 的 Kieran Klaassen 还比较了同一道 Ruby 任务:Fable 5.1 high 写了 26 行,Opus 5.5 extra-high 写了 14 行,省掉了他不喜欢的解释性注释。在其程序性能测试中,Opus 生成的代码达到 427 次请求/秒,满足 20 项响应时间上限中的 17 项;Astra 的代码为 463 次/秒、14 项。前者峰值吞吐较低,却满足了更多延迟要求。这测的是生成程序的性能;Kieran 所说“约有 Fable 九成编程能力”则是个人使用判断。

Kieran 还用它搭建摄像头心率原型和 Cozy Island 三维岛屿。他认为 extra-high 的岛屿细节和镜头控制更好,胜过自己测试的 Fable 版本。

Opus 5.5构建的摄像头心率监视器原型
Every / Kieran 的心率原型:截图中的 72 BPM 标为合成信号演示,并非真实心率测量结果。
Cozy Island基准测试对比:左为Fable 5.1,右为Opus 5.5
Every / Kieran 的 Cozy Island:左为 Fable 5.1,右为 Opus 5.5,可见房屋、码头与时段滑杆。

但漂亮的界面仍要跑通核心流程。Mike Taylor 的语音表单任务运行了 30 分钟、消耗约 590 万 Token:首页与登录页看起来不错,自动检查也通过了,实际打开构建和访谈页面却报错,指定 AI 服务也没有被调用。审查代码后,还要亲自走一遍应用的主要操作。

知识工作:查得清,交付也更完整

在 GDPval-AA v2.1 的专业工作测试中,Opus 5.5 取得 1846 Elo,高于 Fable 5.1 的 1735 和 Opus 5 的 1708。Elo 表示相对表现,不是正确率。按官方曲线,medium 已超过 Astra max,估算任务费用约为其五分之一。

GDPval专业知识工作得分与任务费用
GDPval-AA:同一专业任务表现下,Opus 5.5 提供了更低费用的选择;最高档为 1846 Elo。

一个具体例子是财报查证。Anthropic 在财报新闻稿难以定位的网络副本中设置检索任务,要求模型检索并写季度报告,再逐个核查数字与引文。只要出现捏造,整份报告就不合格。Opus 5.5 的 18 次尝试中有 16 次通过,Fable 5.1 和 Opus 5 在这项测试中都没有通过。另一个内部测试让模型分析两家虚构 HR 软件公司的并购,做 Excel 财务模型和管理层汇报;两款模型估值结论相同,但 Opus 5.5 的产物更完整、易读,耗时 63 分钟对 93 分钟,费用低 50%。

跨应用的 AutomationBench 得分从 Opus 5 的 26.9% 提升到 40.0%,但仍低于 Astra 的 41.4%。科学智能体测试也是 Astra 较高:64.6% 对 58.7%。

AutomationBench跨应用工作流通过率与费用
AutomationBench 由 Zapier 运行。Opus 5.5 曲线优于 Opus 5 与 GPT-5.6 Sol,最高分略低于 Astra;测试中拦截调用计作失败。

在大规模资料收集的 WANDR 测试中,Opus 5.5 从 low 的约 31% 提升到 max 的约 72%,显示复杂检索仍可能受益于更多预算。

WANDR资料收集测试在不同预算下的结果
WANDR:更高思考预算提高得分,也增加费用;使用的是 Anthropic 披露的离线工具设置。

Every 的咨询测试呈现了另一面:模型与一个模拟 Dan Shipper 的智能体谈判,连续修改 12 轮后达成共识;但限时 10 分钟制作客户培训流程表时,它先想了近 5 分钟,再制作训练数据、核对资产负债表,到第 9 分钟才写讲义,最终没交出逐分钟流程表。能持续推敲,不代表能排对交付优先级。

费用降低:单价更低,完成任务也更省步骤

官方所说的“典型任务费用低约 40%”,包含两部分:每个 Token 更便宜,以及完成任务所用的 Token 更少。Token 是模型处理与计费的文本片段,两者共同决定最终账单。

Opus5.5与Opus5每百万Token价格
官方价格表:输入与输出单价下降 20%,缓存读取单价下降 60%。
每百万 Token Opus 5.5 Opus 5
输入 4 美元 5 美元
输出 20 美元 25 美元
缓存读取 0.20 美元 0.50 美元
缓存写入 5 美元 6.25 美元

对比 Fable 5.1 的每百万 Token 输入 10 美元、输出 50 美元,Opus 5.5 的 4 / 20 美元均低 60%。

智能体会反复携带系统提示词、工具定义和上下文。能够重复使用的前缀命中缓存后,可以按更低的读取价格计费。因此,一项任务里缓存占多少、模型调用多少轮,都会改变总费用。下方的账单计算器展示相同用量下,缓存比例如何影响费用。

同样的 token 用量,缓存比例如何改变账单?

计算示例:每轮累计 100 万输入 token、10 万输出 token,只比较普通模式单价;不含缓存写入费用,也不假设新模型会少用 token。

Opus 5
$3.90
Opus 5.5
$2.96
单价带来的节省
24.1%

80% 的输入命中缓存时,相同用量的费用减少 24.1%。

公式:普通输入量 × 输入单价 + 缓存读取量 × 缓存读单价 + 输出量 × 输出单价。官方“典型任务便宜 40%”还包含 token 用量变化,不能由这个固定用量示例直接推出。

标准模式的输出生成速度,官方称比 Opus 5 快 30% 以上。Claude Code 和开发平台还有 Fast mode,生成速度最高为标准模式的 2.5 倍,输入与输出价格分别为每百万 Token 8 和 40 美元。它适合愿意多付费用缩短等待的场景。

真正用起来:给目标,也给停止点

Every 的 Tyler Nishida 只给了一条高尔夫游戏提示词,模型就组建了一个架构师、三位设计师和三位裁判协作的团队,运行了 1 小时 52 分钟,直到他的测试访问结束。成品截图中可以看到雷雨、浮岛、击球倒计时和球杆控制。

Opus 5.5自主搭建的高尔夫游戏原型截图
Every / Tyler Nishida 的高尔夫游戏原型。单条提示词启动的是近两小时的自主制作过程。

持续做事也会持续消耗额度。Every 有测试者碰到了周用量上限;模型还曾主动否决自己生成的 90% 以上 UI 组件,Tyler 无法从理由中找到清楚的评价标准。

派发长任务时,先说明最终交付物、时间或费用预算,以及什么条件下应该停止。先交出能用的核心结果,再决定是否继续润色,往往比让模型不断给自己加任务更有效。Every 团队对模型的偏好并不一致:有人转回 Claude 做视觉和产品开发,有人仍用 Astra 编辑文章,取舍取决于具体工作。

Every 的 32 秒试用建议短片,无音轨;具体案例已在上文展开。

Opus 5.5 已在 Anthropic 开发平台及 AWS、Google Cloud、Microsoft Azure 提供,API 模型 ID 为 claude-opus-5-5。Pro、Max、Team 和按席位计费的 Enterprise 五小时额度提高,订阅用户还获得一次可保存、择时使用的额度重置。Sonnet 5.5 与 Haiku 5.5 将在后续几周推出。

安全方面简要说:Anthropic 称其行为审计表现进一步改善,并为高风险任务配置了生产防护;部分场景会拦截或转交其他模型,具体取决于产品与接入方式。日常使用最值得关注的,仍是这次更强的工作能力、更清楚的沟通,以及完成同一项任务所需的时间和费用。

来源
Introducing Claude Opus 5.5Anthropic·2026-09-22·查看主材料
m
musen@musen9527

不上班研究僧musen · 真实为底,讲透为骨,人话为形。专注 AI 突破、Coding Agent、自动化全栈实操工程。

在 X 上关注↗

继续探索更多前沿实操

产品发布
微软发布新版 Copilot:想打造的是一套面向工作的“AI 操作系统”
Home 把对话接上 Office 文件,Code 让业务人员构建小工具,Autopilot 接手跨天跟进。微软还要一起解决它们在哪里运行、用什么业务数据,以及怎样收费。
产品发布
Google 发布 Gemini 3.8 Live Avatar:打造实时对话的数字人
它能同时听语音、看画面,并用同步的声音和动态形象回应;后台工具调用让接待、导览等对话持续进行。
产品发布
Google 发布 Gemini 3.8 Flash TTS语音模型 让你像导演一样逐行指导配音
新的文字转语音模型支持用描述设计声音、用短录音复刻声音,并用剧本标记控制语气、叹气、笑声和对方插话。本文讲清两款模型的区别、脚本写法、评测里的领先与落后,以及在哪能用。