区块链文库报道:
Anthropic 发布 Claude Opus 5,性能与旗舰持平,价格减半
Anthropic 于 7 月 24 日(周五)发布了 Claude Opus 5。该公司将其定位为:在智能水平上接近 Fable 5,但价格仅为后者一半的模型,面向开发者与企业买家。
该模型距 Opus 4.8 发布仅两个月,为注重成本的团队提供了一个比旗舰模型更便宜的默认选项——此前他们一直在为使用旗舰模型支付溢价。
Opus 5 以一半价格实现与 Fable 5 同等性能
Anthropic 表示,Opus 5 的运行成本与前代相同,但性能大幅提升。该模型在编程评估基准 Frontier-Bench v0.1 上优于所有竞品,每项任务成本更低,且性能是 Opus 4.8 的两倍以上。不过,这需要权衡:买家可通过“努力程度”设置进行控制,既可选择最大智能模式,也可降低智能水平以节省 token,从而获得更快、更便宜的答案。
目前,Opus 5 已成为 Claude Max 的默认模型,也是 Claude Pro 中能力最强的选项。Anthropic 将其定位为日常使用的“主力模型”,而非专用模型,并声称其效率优于同级别的其他替代方案。
在 CursorBench 3.2 编程测试中,Opus 5 在最大努力模式下,得分与 Fable 5 的最佳成绩相差不到 0.5 个百分点,而每项任务成本仅为后者的一半。这款较小的模型(即 Opus 5)在 Anthropic 公布的多个基准测试中甚至直接击败了 Fable 5。
在新颖问题测试 ARC-AGI 3 中,Opus 5 的表现比第二名模型高出三倍。在 Zapier 的 AutomationBench 基准测试中,其通过率约为最接近竞品的 1.5 倍,而成本相同。在 OSWorld 2.0 计算机使用基准测试中,Opus 5 以三分之一的成本超越了 Fable 5 的最佳成绩。
Anthropic 承认,在网络安全工作中,Opus 5 落后于 Mythos 5。
更少的限制与新增的自动回退功能
Opus 5 不受 Fable 和 Mythos 所适用的 30 天数据保留策略约束。Anthropic 预计,与 Fable 5 相比,Opus 5 的安全分类器触发率将降低 85%。
不过,安全任务仍设有护栏:Opus 5 无法扫描编译后的软件二进制文件以查找漏洞,但可以搜索源代码中的漏洞,因为源代码层面的工作被视为更具防御性。Anthropic 正在推出一个名为“自动回退”(Automatic Fallbacks)的测试版功能,以减少分类器触发时的困扰。该功能会将触发标记的请求路由到较弱的模型,确保 API 用户获得可用的答案,而非错误提示。
Anthropic 举例说明了该模型如何绕过障碍而非止步不前。在 Frontier Bench 的某一项任务中,模型被展示了一张机器零件的图纸,并要求将其还原为 3D FreeCAD 模型。但模型无法直接看到图片。Opus 5 自行编写了计算机视觉代码,从原始像素中读取几何信息,并重建了零件。没有其他模型在五次尝试后成功。
Devin 的 CEO Scott Wu 引用 Anthropic 的发布材料称,该模型在其公司的 FrontierCode 1.1 测试中“以一半成本达到了接近 Fable 的性能”。Zapier 的 CEO Wade Foster 表示,Opus 5 登顶了其公司的 AutomationBench 排行榜,并在一个端到端的流失预防工作流中实现了 100% 的通过率,而早期模型均未能完成该任务。在生命科学领域,Anthropic 报告称,Opus 5 在从光谱数据推断分子结构方面,比 Opus 4.8 提升了 10.2 个百分点。
Mythos 5、Fable 5 和 Sonnet 5 已于今年 6 月发布。目前,Haiku 是唯一仍停留在上一代的产品。该公司在 2025 年 11 月达到了约 3500 亿美元的估值,其约 80% 的收入来自超过 30 万的企业和商业客户。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




