区块链文库报道:
OpenAI新模型与Anthropic模型基准测试互有胜负,Fable优惠窗口将于7月19日关闭
核心要点
OpenAI推出了三个独立的GPT-5.6版本:Sol、Terra和Luna,取代了此前单一模型的做法。
独立测试发现,Claude Fable 5在创意和编程任务上略优于GPT-5.6 Sol,而Sol在大多数标准化基准测试中领先。
Anthropic已三次延长付费用户免费使用Fable 5的期限,当前截止日期为7月19日。
Sol定价详情
OpenAI于7月9日将GPT-5.6全面开放,此次发布分为三个独立模型,而非一个可调节的系统。Sol作为旗舰版本,Terra定位中端,Luna则负责较轻量级的任务。
Sol的收费标准为每百万输入token 5美元,每百万输出token 30美元,仅为Anthropic对Fable 5定价(输入10美元、输出50美元)的一半。更便宜的Luna(输入1美元、输出6美元)在编程基准测试上已经超越了Claude Opus 4.8,OpenAI随后也证实了这一数据。
一家评测机构详细描述了Fable 5经历的动荡时期。6月12日,美国出口管制导致该模型在全球范围内下线,而彼时距离其原定的免费访问窗口关闭仅剩数天。
监管机构于6月30日解除了这些限制。Anthropic于7月1日恢复了Fable 5,随后三次延长其促销定价截止日期,最近一次调整至7月19日。
测试结果呈现分歧
在标准化测试上,Sol总体领先。在人工智能分析编码代理指数中,Sol得分为80,Fable为77.2;另一项基准测试追踪器显示,在智能体最终考试中,Sol得分为53.6%,Fable为40.5%。然而,在更广泛的智能指数上,Fable 5以微弱优势领先Sol一分。
实际测试则呈现了更接近的结果。评测者通过两个模型运行相同的提示词,认为它们在创意写作和逻辑谜题方面的输出大致相当,各自拥有独特的优势。
Fable 5在一项任务上明显胜出。在构建浏览器游戏的单次编程测试中,Fable 5版本包含了音乐、动画和道具增强功能,而Sol的版本则完全忽略了这些元素。
Fable 5自6月9日首次亮相以来,其访问历程异常曲折。该模型最初承诺免费使用至6月22日,但在此之前因出口争端而断供,7月1日恢复时设置了更严格的周限额,随后其付费截止日期又两次推迟,先是7月12日,现在为7月19日。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




