在推出旗舰级模型Claude Opus 5.5仅仅七天后,Anthropic再度推出Claude 5.5系列的第二款产品。
当地时间9月28日,Anthropic正式发布了Claude Sonnet 5.5。这款面向日常办公、软件开发等应用场景的主力模型,在保持API名义价格不变的前提下,进一步提升了生成速率与任务执行效率。
官方数据表明,Sonnet 5.5的输出生成速度提高了超过30%。更值得注意的是,在需要频繁调用工具、反复执行步骤的任务中,新模型通过减少冗余推理和工具调用,使单项任务的综合成本最多降低了30%。
性能方面的变化同样显著。在多项软件工程、知识工作及计算机操作基准测试中,Sonnet 5.5已接近甚至超越Opus 5.5在部分测试配置下的表现。
01 编程能力大幅增强,部分测试成绩超越Opus 5.5
Anthropic官方基准测试对比图显示,Sonnet 5.5与上一代Sonnet 5之间的差距,在编程任务中最为突出。
在自主智能体编程测试Terminal-Bench 4.0中,Sonnet 5.5得分达到70.6%,而上一代Sonnet 5仅为10.3%。这一成绩甚至超过了上周发布的Opus 5.5在高算力档位(Xhigh)下的66.4%。
在真实编辑器场景测试CursorBench 4.0中,Sonnet 5.5取得了55.5%的成绩,较Sonnet 5的34.1%明显提升,与Opus 5.5的57.8%仅相差2.3个百分点。
在高强度编程测试FrontierCode 1.1中,Sonnet 5.5在High努力等级下的成绩比上一代高出10个百分点,同时单任务运行成本约为Sonnet 5的十五分之一。
知识工作领域的表现同样接近旗舰模型。
在覆盖44种职业真实工作场景的GDPval-AA v2.1测试中,Sonnet 5.5获得1844分,高于Sonnet 5的1449分和OpenAI GPT-6 Sol的1487分,与Opus 5.5的1846分几乎持平。
在跨学科推理测试Humanity's Last Exam的工具模式下,Sonnet 5.5取得64.5%的成绩,高于Sonnet 5的54.9%,距离Opus 5.5的67.7%也只有3.2个百分点。
第三方评测也显示出类似趋势。大模型评测平台Artificial Analysis的数据显示,Sonnet 5.5在其“智能指数”(Artificial Analysis Intelligence Index)中获得56分,仅比Opus 5.5低2分;在最高推理努力模式下,其得分较上一代Sonnet 5提高18分。
计算机操作能力同样出现明显提升。在OSWorld 2.1部分评估中,Sonnet 5.5准确率达到80.1%,较Sonnet 5的57.0%大幅提升,与Opus 5.5的81.8%相差不大。
视觉理解方面,Sonnet 5.5在Chartography无工具模式下的准确率从上一代的15.6%提升至61.6%,超过GPT-6 Sol的53.6%,接近Opus 5.5的64.4%。
不过,推理投入并非越高越好。
在FrontierCode测试中,Sonnet 5.5在最高算力档位(Max模式)下的得分为46.2%,反而低于次高档位(Xhigh模式)下的52.1%。
Anthropic解释称,Max模式赋予了模型最高的推理自由度,但这更容易触发频繁的代码审查以及子任务拆分;在部分场景中,过度思考反而导致任务超时或产生了超出范围的代码修改,最终影响了测试成绩。
这一结果也说明,在智能体任务中,额外增加推理和执行步骤并不一定带来更高的任务完成度,如何控制计算量和执行路径,同样是模型优化的一部分。
02 用更少Token干更多活
相比性能提升,Sonnet 5.5此次更值得关注的变化,是成本结构。
Sonnet 5.5的输入、输出和缓存写入价格均为Opus 5.5的一半。
其输入价格为每百万Token 2美元,输出价格为每百万Token 10美元,与GPT-6 Sol处于同一水平。
相比之下,旗舰级Claude Opus 5.5的输入价格为每百万Token 4美元,输出20美元;轻量级GPT-6 Luna的价格则进一步降至输入每百万Token 0.1美元、输出0.5美元。
因此,Anthropic这次强调的并不只是“每百万Token多少钱”,而是完成一项任务究竟需要消耗多少Token、调用多少次工具,以及花费多少时间。
Artificial Analysis发布的“智能指数与单任务成本关系图”也显示,Sonnet 5.5虽然单任务输出Token数量较高,但凭借较高的任务完成效率,其单任务成本仍处于较低水平。这意味着,对于Agent任务而言,单纯比较每百万Token价格,已经很难完整反映实际使用成本。
在保持基础价格不变的情况下,Anthropic强调,Sonnet 5.5可以通过减少任务执行步骤和冗余推理,降低实际任务成本。更频繁地批处理工具调用,也有助于减少Agent执行过程中的额外开销。
Anthropic研究产品经理Theo Chu在接受CNBC采访时表示,Sonnet主要面向对成本比较敏感、但并不需要顶级智能水平的客户。对于大量日常、重复性的任务而言,用户并不一定需要Opus级别的深度判断能力。
这也让Sonnet 5.5与Opus 5.5之间的产品分工更加清晰:前者重点解决大量任务的效率和成本问题,后者则承担对复杂性和判断能力要求更高的工作。
在此基础上,提示词缓存也进一步降低了重复任务的成本。Anthropic提供最高90%的提示词缓存折扣,对于需要反复处理相同上下文或长文档的开发者而言,实际支出还可能进一步下降。
一些早期测试反馈显示,Sonnet 5.5在用户界面重构、按照既定模板生成演示文稿等任务中表现较好,生成结果所需要的人工修改较少。
03 安全机制也升级了
随着模型代码能力和智能体执行能力提升,安全问题也成为Sonnet 5.5此次升级的重要组成部分。
Anthropic表示,由于Sonnet 5.5在网络安全和渗透测试方面的能力出现明显提升,该模型成为首款在发布时即采用与Opus 5及Fable 5.1同等级别网络安全防护机制的Sonnet模型。
其中一项机制是高风险请求重定向。当系统识别到高风险的网络攻击或渗透请求时,会将相关任务转交给Sonnet 5处理,同时尽量避免影响正常的软件开发和漏洞修复工作。
第二项是针对模型蒸馏的数据提取防护分类器。Anthropic希望借此减少竞争对手或恶意团队通过大规模API查询,系统性复制和提取模型内部能力的风险。
此外,Anthropic还强调了合规与隐私能力。Sonnet 5.5符合欧盟AI法案相关水印要求,并继续在AWS、Google Cloud、Microsoft Azure以及Anthropic官方API等渠道提供零数据保留选项。
对于Anthropic而言,模型能力提升的同时,安全控制也需要同步升级。
04 Haiku 5.5随后登场
随着Sonnet 5.5发布,Anthropic的Claude 5.5产品线已呈现出较为清晰的分工。
Opus 5.5负责复杂推理、深度判断和高难度任务;Sonnet 5.5则承担软件开发、办公自动化以及大量需要智能体持续执行的日常任务;Haiku 5.5则将进一步覆盖高吞吐、低成本的轻量级任务。
Anthropic在官方公告中确认,Haiku 5.5将在未来几周内推出。
从这套产品布局来看,Anthropic正在把模型之间的差异从单纯的能力比拼,进一步扩展到任务类型、执行效率和使用成本。
Sonnet 5.5的出现,也让Claude 5.5系列的产品分工更加清晰:Opus继续承担高难度任务,Sonnet负责更大规模的日常工作,Haiku则覆盖对速度和成本更加敏感的场景。
对Anthropic而言,接下来的竞争也将从单一模型的能力比拼,转向模型性能、执行效率和使用成本之间的综合较量。Sonnet 5.5能否凭借这一思路进一步扩大企业用户规模,还要看其进入真实生产环境后的表现。用户可访问开云网页版登录入口获取更多技术细节。
本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。


2条评论
想了解更多开云首页登录相关内容,尽在开云平台登录入口。
开云平台登录入口围绕基于真实游戏场景串联阅读与思考路径,提升解谜效率。不断创新,回应用户的真实需求。
精选覆盖多平台热门游戏的深度世界观设定解读。内容,开云平台登录入口与你一同发现更多精彩。
开云平台登录入口专注每篇内容均标注技能组合差异与注意事项,便于用户复用。,为用户提供专业可靠的体验。
围绕定期更新活动玩法专题,帮助用户形成独立见解。,开云平台登录入口持续打磨更优质的服务。
围绕开云首页登录,开云平台登录入口持续打磨更优质的服务。
开云平台登录入口深耕基于真实游戏场景串联阅读与思考路径,提升解谜效率。领域,用心服务每一位用户。
在覆盖多平台热门游戏的深度世界观设定解读。方面,开云平台登录入口提供贴心周到的支持。