Meta的Muse Code内置崩溃安全日志,但Claude Opus 5在基准测试中仍保持领先

区块链文库报道:

Meta 发布 Muse Code(测试版):一款终端编码代理

Meta 于周三发布了 Muse Code(测试版),这是一款基于终端的编码代理。

该公司公布的图表显示,该模型在大多数编码测试中击败了 OpenAI 的 Codex 和 Google 的 Antigravity,但在 Meta 发布的所有基准测试中均输给了 Anthropic 的 Claude Opus 5。

Muse Code 落后于 Opus 5,但配备了崩溃安全日志

Muse Code 由 Muse Spark 1.2 驱动,这是 Meta 于 7 月向美国开发者开放的编码模型的更新版本。

在 Meta 展示的编码基准测试中,Muse Spark 1.2 落后于 Opus 5,但在大多数项目上优于 Codex 和 Antigravity。Meta 表示,该模型是其“迈向前沿的下一步,更大、更强大的模型即将推出”。

该公司表示,1.2 版本在代码生成、调试以及理解大型代码库方面表现更佳,因为它在训练期间增加了编码任务的计算投入。

在一个案例研究中,该模型在超过 1000 次工具调用中重新编写了 NVIDIA Hopper 芯片的 GPU 内核,耗时长达 24 小时,并且从基线出发,要求不复制现有库中的代码。

Muse Code 维护一个本地事件日志,记录所有模型调用、工具运行、审批和编辑操作。Meta 在博客文章中写道:“这一单一事实来源使得运行时可以精确重放并安全重启。”如果发生崩溃,代理可以从断点处继续工作。该代理还会在整个会话期间保持后台子代理的运行。

Meta 首席执行官马克·扎克伯格在一篇文章中写道:“当任务足够大时,它会分派到独立的子代理,这些子代理在隔离的工作树中并行工作。”他补充道:“你的工作副本永远不会被触及。在测试中,我们让它同时为游戏构建了六个功能,且没有发生冲突。”

/plan、/grill 以及 Meta 对成本的押注

Muse Code 内置了多个命令。/plan 将请求转化为需要审批的计划,/grill 对该计划进行压力测试直至其稳定,/goal 则推动实现既定目标。

开发者可以通过一条 curl 命令在 macOS 或 Linux 上安装该代理。Muse Spark 1.2 也可通过 Meta 模型 API 获取。该模型与代理成对工作,Muse Code 工具集确保它们兼容。

部分训练数据由较旧的 Muse Spark 1.1 生成,用于产生困难的编码问题并对候选答案进行评分。Meta 称,这一循环帮助新模型更严格地遵循指令。

Meta 向投资者表示,预计今年将在芯片、数据中心和其他基础设施上投入 1250 亿至 1450 亿美元。由于在基准测试中无法超越 Opus 5,该公司转而通过价格竞争。代号为“Watermelon”的更大规模 Meta AI 模型仍在训练中。

© 版权声明
THE END
喜欢就支持一下吧
分享