Anthropic 57天密集更新!Opus 5性能比肩Fable 5,价格减半还更高效

   时间:2026-07-26 04:56 来源:快讯作者:钟景轩

AI模型领域的竞争愈发激烈,Anthropic再次成为焦点。这家公司刚刚推出了新一代模型Opus 5,其性能直逼旗舰产品Fable 5,但价格却大幅降低,引发行业广泛关注。

在短短57天内,Anthropic完成了对Claude主要产品线的全面更新。5月28日,Claude Opus 4.8发布;仅12天后,能力更强的Fable 5和Mythos 5相继登场;6月30日,Sonnet 5上线;7月24日,Opus 5正式发布。这种更新速度在按月迭代的AI行业中也属罕见,尤其是Fable 5和Opus 5之间仅间隔45天,令人意外。

Anthropic的这轮更新与OpenAI的节奏高度契合。7月9日,OpenAI发布GPT-5.6,并在官方评测中将Fable 5列为主要参照模型之一。15天后,Anthropic发布Opus 5,并将GPT-5.6 Sol作为核心对比对象,在陌生问题求解、电脑操作和商业流程等项目中展示自身优势。两家公司在产品发布和宣传上的"对标"意味十分明显。

Opus 5的性能提升显著。Anthropic公布的数据显示,在Frontier-Bench v0.1评测中,Opus 5超越了所有其他模型;与Opus 4.8相比,其任务完成成本更低,成绩却提高了一倍以上。在CursorBench 3.2评测中,最高投入档位下,Opus 5与Fable 5的得分差距不到0.5%,但成本仅为后者的一半。在high、xhigh和max三个投入档位下,按相同成本比较,Opus 5的表现也优于所有其他模型。

在知识工作和问题解决任务中,Opus 5同样表现出色。在ARC-AGI 3这类"陌生题"测试中,Opus 5的得分达到第二名的3倍,显示其在面对未见问题时,通过试错找到解法的能力更强。AutomationBench评测中,Opus 5的任务通过率约为第二名的1.5倍;即使使用最低投入档位,也超过其他模型的最高成绩。这意味着Opus 5无需最高推理成本即可完成更多任务。

在电脑操作测试OSWorld 2.0中,Opus 5在各个成本区间均保持领先。其成本仅为Fable 5的三分之一多一点,成绩却超过了Fable 5的最高水平。这表明Opus 5在打开应用、查找信息、跨软件操作和任务推进方面的效率明显更高。HLE跨学科难题评测中,不调用工具时,Opus 5以56.3%略低于Fable 5的56.5%;允许使用工具后,其得分升至64.7%,反超Fable 5的63.9%,且成本更低。

在模拟真实知识工作的GDPval-AA v2评测中,Opus 5最高得分1861,高于Fable 5的1747和GPT-5.6 Sol的1736。大约花费700美元,即可达到其他模型最高投入档位附近的成绩。DeepSearchQA评测中,Opus 5同样以更低成本取得了略高的通过率。在生命科学领域,Opus 5在所有评测中均超过Opus 4.8,光谱推断分子结构和预测蛋白质变异影响两项任务分别提高10.2和7.7个百分点,显示其在科研环节的潜力。

Anthropic还展示了Opus 5的视觉生成能力。一个可操作的三维风洞演示中,用户可以旋转汽车、调整风速,观察气流变化并查看阻力系数等数据。另一个三维动物细胞模型演示中,用户可以转动、剖开细胞,点击查看各结构说明,页面还会主动指出示意图的简化之处。这两个案例显示,Opus 5已能将代码、三维建模、交互界面和知识讲解整合到同一成品中,可直接搭建接近教学软件或产品原型的演示。

随着模型能力提升,安全与对齐问题成为关注焦点。Anthropic通过多个案例说明Opus 5比此前模型更擅长独立推进任务。例如,在根据机械零件图纸重建FreeCAD三维模型的测试中,Opus 5自行编写计算机视觉程序提取尺寸和几何结构,完成了建模任务,而其他模型连续尝试5次均未成功。在开源软件包管理器任务中,Opus 5不仅查出了程序错误的根本原因,还补上了社区修复方案遗漏的边缘情况。

Anthropic强调,Opus 5是目前对齐表现最好的Claude模型。上线前的自动化审计显示,与Opus 4.8、Sonnet 5和Fable 5相比,Opus 5更能遵守Claude宪法,欺骗行为更少,也更难被诱导执行有害请求。在网络安全领域,Opus 5寻找代码漏洞的水平已接近Mythos 5,但在编写漏洞利用程序和发动实际攻击方面仍明显落后。相比Fable 5,新分类器触发干预的频率预计减少约85%,正常安全研究更少被误伤。

Opus 5延续了Opus 4.8的价格体系,每百万输入Token 5美元、输出Token 25美元。在多项编程和智能体测试中,新模型不仅完成率更高,单位任务成本反而下降。与直接对手OpenAI的GPT-5.6 Sol相比,两者输入价格相同,但Opus 5的输出价格低约17%。处理超长资料时,Opus 5的价格优势更明显。Anthropic对最高100万Token的上下文维持普通单价,而GPT-5.6 Sol的输入超过27.2万Token后,整次请求的输入价格翻倍,输出价格提高50%。对于大型代码库、长篇研究资料和复杂智能体任务,这项差异将直接反映在账单上。

根据Anthropic公布的评测,Opus 5虽然在所有项目中未必都胜过GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续做事的任务上,表现和价格都更具竞争力。目前,Opus 5已成为Claude Max的全新默认型号,也是Claude Pro的最强型号,专为日常使用而设计,效率高于其他型号。

 
 
更多>同类内容
全站最新
热门内容