Claude Opus 5.5发布,降价四成“干掉”Fable 5.1? - 精品品牌

  • Shipgo
  • 2025年8月29日
  • 03 评论

精选开云中国内容,Kering与你一同发现更多精彩。

Kering

Anthropic联合创始人兼首席执行官达里奥·阿莫迪。图片经过AI处理

9月22日,Anthropic推出了Claude 5.5系列的首款模型Opus 5.5。

三周前,该公司才刚刚发布了旗舰模型Fable 5.1;如今,Anthropic表示,Opus 5.5在多数工作任务中的表现已与Fable 5.1相当。相比上一代Opus 5,新模型的输出速度提升了超过30%,输入和输出Token的单价下降了20%;在默认设置下的典型任务中,完成工作的成本降低了约40%。性能对比的对象是Fable 5.1,而成本降幅的对比对象则是Opus 5。

Fable刚刚以顶级模型的定位亮相不久,接近其能力水平的版本就被放入了更便宜的Opus中。这又是一个用更便宜、更快速的新模型,“内卷”自家上一代旗舰模型的案例吗?

更值得关注的是发布的时机。就在上周,Anthropic的CEO达里奥·阿莫迪(Dario Amodei)刚刚发表文章,呼吁AI前沿的发展应当“放慢节奏”,主张安全实践需要领先于模型能力。Opus 5.5是他在此表态后,Anthropic发布的首个模型,官方称发布前已接受了Frontier Design和METR等外部机构的评估测试。

性能、成本、安全——这是Opus 5.5试图讲述的“新故事”。

01、编程与知识工作双双领先,性价比才是核心卖点

Opus 5.5在智能体编程、计算机使用和知识工作这三个核心方向上,均处于当前模型的第一梯队。

官方基准测试显示,它在Terminal-Bench 4.0、FrontierCode、CursorBench等编程测试中处于领先地位,在GDPval-AA v2.1知识工作测试中获得了1846 Elo的分数,也超过了Fable 5.1和GPT-6 Astra。在独立评估平台Artificial Analysis的智能指数中,Opus 5.5以58分位居榜首,在十项评估中领先了六项。

不过,Anthropic自己也承认,在当前的能力水平下,基准测试的差距已经越来越难以可靠地反映现实世界中的差异。这意味着模型竞争正进入一个新阶段——单纯依靠跑分的边际收益正在递减,用户真正关心的是实际工作中的表现、成本以及可靠性。

Anthropic公布了一个早期测试案例:一名测试者使用Opus 5.5在不到一天的时间内完成了68万行代码的迁移工作,而同样的任务原本需要一个工程团队花费数周时间。

在另一项测试中,Opus 5.5在不到三个小时内审计并修复了一个20万行的代码库。相比之下,Opus 5完成同样的任务耗费了20多个小时,消耗的token量也是Opus 5.5的2.5倍。

不过,CodeRabbit将Opus 5.5接入代码审查流程后,在一组包含80种已知问题的测试中发现了51种,而现有的生产模型组合发现了49种。两者发现的问题并不完全重合:Opus 5.5找出了现有组合遗漏的11种,其中包括Cal.com中多个任务可能互相覆盖重试计数的并发问题;同时,它也遗漏了现有组合能够发现的9种。

在内部测试中,Anthropic让Opus 5.5和Fable 5.1将广泛使用的负载均衡软件HAProxy从C语言重写为Rust。两个模型都通过了几乎所有HAProxy自身的回归测试,但Opus 5.5只用了9.5小时,而Fable 5.1用了12小时,前者的成本低了51%。

性价比是此次发布的核心卖点。在多个编程基准测试中,Opus 5.5都以更低的成本达到或超越了竞争模型的表现。在FrontierCode上,Opus 5.5在默认努力级别下就能击败GPT-6 Astra,成本大约只有后者的五分之一。在Terminal-Bench 4.0上,它与GPT-6 Astra性能相当,成本约为后者的40%。

科技媒体THE DECODER评论称,此次降价的背后是来自OpenAI,尤其是中国AI模型的竞争压力。Anthropic选择在性能追平的同时大幅降价,实际上是在性价比维度上开辟了一条新的竞争战线。

GitHub首席产品官马里奥·罗德里格斯(Mario Rodriguez)在测试后表示,在GitHub Copilot CLI和VS Code的测试中,Claude Opus 5.5所使用的token和步骤是测试过的模型中最少的,在VS Code里用不到一半的步骤就解决了比Opus 5更多的终端任务。

然而,第三方的实测得出了一些不同的结论。Opus 5.5的性能和成本优势仍然取决于具体任务和推理设置。Sonar在Java测试中发现,它的代码通过率与Opus 5接近,生成的代码更少、严重问题也更少,但每行代码的Bug数量提升了约12%。

Artificial Analysis发现,在最高推理档位下,Opus 5.5每项任务生成的输出Token大约是Opus 5的1.6倍,单任务成本与Opus 5大致持平。降价能否转化为用户账单上的实际节省,还需要看具体的使用场景。

知识工作方面同样有显著提升。在GDPval-AA v2.1测试中,Opus 5.5获得了1846 Elo分,领先于Fable 5.1和Opus 5,也明显高于GPT-6 Astra。这项测试涵盖了44种职业的真实工作场景。

Anthropic进行了一项内部测试:让模型撰写公司季度业绩报告,信息来源是一份网页副本,财报被放在很难找到的位置,自动评分器逐字逐句核对每个数字和引述的来源。结果显示,Opus 5.5生成的18份报告中有16份通过了质量门槛,而Fable 5.1和Opus 5在任何一次尝试中都没能通过。

Opus 5.5还配备了行动前分类筛查、开源沙箱和代码审查漏洞拦截这三层防护。在提示注入攻击测试中,它在编程、工具使用、计算机使用和网页浏览等所有场景下的表现都持平或优于Opus 5。AI安全公司Gray Swan的基准测试显示,Opus 5.5与Fable 5.1并列成为提示注入成功率最低的模型。

不过,在自动化工作流(AutomationBench)和智能体科研(Terminal-Bench-Science 0.1)方面,Opus 5.5的表现都不及GPT-6 Astra。

02、告别“Claude体”

在所有改进中,沟通方式的变化可能是用户感知最直接的一项。

长期以来,Claude的写作风格一直被用户诟病——冗长、啰嗦、公式化,有时甚至显得过分讨好,被网友戏称为“Claude体”(Claudish)。Opus 5.5有针对性地解决了这个问题。官方称,新模型会将最重要的信息放在前面,更少使用术语和特有表达方式,更能遵循用户给出的写作规则。

官方提供的对比样例很能说明问题。同样是解释一个计费系统的bug,Opus 5的回答开头是“What I found”,然后大段贴出代码和详细解释,读者需要自己从大量信息中提取关键点。Opus 5.5的回答开头直接给出结论:“额外下降是计费重构中的一个bug”,然后才展开技术细节。先给答案,再讲过程。

Box的AI产品副总裁亚肖达·巴夫纳尼(Yashodha Bhavnani)说:“在我们的评估中,Claude Opus 5.5使用的token是Opus 5的三分之一,答案简洁了40%但没有损失准确性。”

ZDNET评论称,Opus 5有时候简直像个马屁精,尤其是在它做错事的时候。如果新版本哪怕只是少一点谄媚,都值得欢迎。写作风格的改进看起来是个小问题,但对于每天和模型打交道的用户来说,这直接影响使用体验和工作效率。

Anthropic认为,沟通质量的提升不只是体验问题,也是安全问题。当模型的输出更容易理解和检查时,人类审查的效率更高,错误也更容易被发现。从这个角度看,清晰的写作本身就是一种安全增强。

03、首个配备Fable级防护的Opus模型

Anthropic表示,Opus 5.5是第一个配备与Fable 5.1同级别防护措施的Opus模型。这直接呼应了阿莫迪上周提出的“节奏论”——AI进步应该有节奏地推进,让安全实践始终领先于模型能力。

在自动化行为审计,也就是Anthropic最全面的对齐测试(涵盖近2000个模拟场景)中,Opus 5.5在几乎所有错位行为指标上都优于近期的Claude模型,是迄今测试中表现最强的模型。它采取难以逆转行动或越界的可能性远低于近期模型,对提示注入的抵抗力也强于Opus 5。

特别值得注意的是,在一项测试模型突破边界倾向的新评估中,Opus 5.5试图绕过边界的频率比Opus 5或Claude Mythos 5.1低了约85%,而且每次尝试都是低严重级别并会自我报告。对于在代码库和系统中无人值守运行Claude的团队来说,这一点和原始能力同等重要。

但Anthropic也坦诚,构建能在部署前可靠发现每一种失败的评估方法,仍然是一个未解决的问题。有迹象表明,Opus 5.5经常能察觉到自己正在被评估,这给评估它在真实场景中的行为带来了挑战。随着部署场景的扩大和模型能力的增长,这个挑战会越来越大,除非在可解释性方面取得进展。

具体的防护措施涉及三个高风险领域:

网络安全方面,由于Opus 5.5具备极强的网络能力,Anthropic对其应用了与Fable 5.1类似的网络安全防护。用户可以在日常软件开发中查找和修复bug,但大多数网络安全任务会被重新路由到Opus 4.8。网络验证计划将在未来几周扩展到Opus 5.5,新增三个级别的可信访问权限。

生物学方面,Opus 5.5在生物学领域的能力超过了Opus 5,在很多工作上匹配或超过了Claude Mythos 5.1。因此它使用了与Fable 5.1相同的生物学防护。经过审核的机构可以申请生命科学验证计划,获得面向生物学研究的防护配置。

蒸馏防护方面,Opus 5.5配备了“保留思考”(Preserved Thinking)机制,防止API用户编辑Claude的历史上下文来提取其推理过程。这项措施针对的是所谓的“蒸馏攻击”——攻击者使用数千个假账号,以工业规模提取模型能力,制造没有安全防护的高能力模型。Anthropic在2026年9月的威胁情报报告中记录了已检测和阻断的非法蒸馏活动。

此外,Opus 5.5还配备了水印措施以符合欧盟AI法案要求,并且不再提供关闭“思考”模式的选项。模型支持零数据保留选项。

04、订阅用户额度提升两成,后续还有Sonnet和Haiku

价格方面,Opus 5.5相比Opus 5全面下调。输入token每百万4美元,输出token每百万20美元,分别比Opus 5低了20%。缓存读取每百万0.20美元,降幅达60%。缓存写入每百万5美元,比Opus 5的6.25美元低了20%。

再加上模型本身使用token更节省,综合来看,典型工作负载的成本比Opus 5低了约40%。输出速度也快了30%以上。

Opus 5.5还提供快速模式,速度最高可达2.5倍,价格为每百万输入token 8美元、每百万输出token 40美元。

Anthropic提高了Pro、Max、Team以及按席位计费的企业版的五小时使用限额,并提供一次可留待需要时使用的限额重置。官方称,Opus 5.5较低的使用成本,也让原有额度比使用Opus 5时约能多支撑25%的工作量。具体能多完成多少任务,仍取决于所选的推理档位和Token消耗。

目前,Claude Opus 5.5已在所有平台上线,包括亚马逊云服务AWS、谷歌云和微软Azure。在Claude平台上,开发者可以使用模型ID claude-opus-5-5开始调用。

Anthropic还透露,Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周内推出,带来类似的性能、效率和安全改进。

本文来自微信公众号“腾讯科技”,作者:晓静,36氪经授权发布。

围绕从成就收集的体验差异切入,使阅读内容与玩家自身经验相互印证。,Kering持续打磨更优质的服务。

围绕开云中国,Kering持续打磨更优质的服务。

威廉姆森 / 首席执行官

Kering深耕围绕音乐音效与全球精品游戏展开体验差异介绍,让阅读脉络清晰可循。领域,用心服务每一位用户。

Kering为想了解技能组合的玩家梳理比较方法,帮助建立基本认识,从成就收集的体验差异开始,让阅读与自己的体验相互印证,围绕音乐音效,全球精品通过体验差异展开介绍,让阅读有清楚的脉络,以成为实用的游戏阅读平台为目标,持续关注玩家创作的内容特点。

Kering
Kering
Kering
在从成就收集的体验差异切入,使阅读内容与玩家自身经验相互印证。方面,Kering提供贴心周到的支持。
2025年8月2日 下午3:30

Kering以持续关注玩家创作的内容特点,打造实用的游戏阅读平台。为核心,带来高效便捷的体验。

回复
Kering
想了解更多通过结构化比较方法,帮助玩家快速理解不同游戏的技能组合与玩法侧重。相关内容,尽在Kering。
2025年8月2日 下午3:30

Kering围绕Kering不断创新,回应用户的真实需求。

回复

精选开云内容,Kering与你一同发现更多精彩。

Kering专注全球精品,为用户提供专业可靠的体验。

围绕精品品牌,Kering持续打磨更优质的服务。行业洞察

Kering深耕高端时尚领域,用心服务每一位用户。Kering深耕持续关注玩家创作的内容特点,打造实用的游戏阅读平台。领域,用心服务每一位用户。

京ICP备2021994529号
Kering科技有限公司品质,始终如一电话:+86 139 8009 8425邮箱:[email protected]北京市朝阳区建国路35号