专家对Claude Opus 5首次独立测试结果意见不一

区块链文库报道:

独立测试者对Anthropic新模型Claude Opus 5给出评分

独立测试者将Anthropic新发布的Claude Opus 5在能力指数上评为159分,仅比Claude Fable 5低2分,但在代码审查记录方面存在明显分歧。

关键要点

Epoch AI将Claude Opus 5的能力指数评为159分,而Claude Fable 5为161分,两者在软件工程领域持平。CodeRabbit记录的可操作审查评论精确率为39.3%,高于35.2%的基准线,但琐碎评论数量增加了四倍。来自Cognition和Zapier的企业测试者报告称,该模型在调试和端到端业务自动化方面取得了进展。

Claude Opus 5基准测试面临早期审视

Anthropic于上周五发布了该模型,并表示其智能水平接近Fable 5,但价格仅为后者的一半,定位为日常工具而非专业模型。外部评分者大多认同这一评价,但在边际上存在分歧。Epoch AI将Opus 5的能力指数评为159分,而Fable 5为161分,并在软件工程领域将两者评为持平。Artificial Analysis将该模型排在其智能知识工作基准测试的首位,比Fable 5高出近150个Elo分,同时将每项任务成本降低了20%。部分开发者对能力指数提出了异议,他们认为相比旧版Opus 4.8仅提升一个百分点,这严重低估了他们在日常使用中的实际体验。一位评估者发现,在编码测试中,中等努力设置反而优于更高设置。

代码审查结论引发测试者分歧

CodeRabbit对Opus 5进行了测试,使用了约100个来自真实开源拉取请求的错误模式,每种配置运行三次,测量出可操作评论的精确率为39.3%。这超过了其生产审查器设定的35.2%基准线,但该模型捕获的已知错误更少,且产生的琐碎评论数量增加了四倍——这些低价值注释需要工程师手动分类。在默认努力设置下,精确率降至26.4%。该公司得出结论,团队应将Opus 5视为第二个注重精确度的审查器,而非直接升级现有运行良好的流水线。Claire Vo负责为产品团队进行七模型评估,她称该模型“出色但令人恼火”,并指出其存在神经质倾向,以及坚决拒绝处理合并冲突的问题。

Anthropic客户报告智能体能力提升

Cognition首席执行官Scott Wu表示,Opus 5在Devin内以一半的成本实现了接近Fable级别的性能,尤其在调试和根本原因分析方面表现出色。Zapier负责人Wade Foster称,该模型在公司的自动化排行榜上名列前茅,且消耗的令牌数并未超过此前定价相同的Claude版本(每百万输入令牌5美元)。这些赞誉也存在局限性。Anthropic指出,Opus 5在网络安全攻击工作方面落后于其Mythos 5模型,且被公司安全分类器标记的请求会自动回退至Opus 4.8。这一谨慎态度源于顶级模型近期的波折——Fable 5于六月发布,仅数日后便暂停服务,直至七月初才重新向用户开放。

© 版权声明
THE END
喜欢就支持一下吧
分享