区块链文库报道:
研究发现:Claude代理在冲突指令下相互攻击
Anthropic前沿红队于8月13日发布的研究显示,Claude代理在收到带有冲突指令的单一编程任务时,会利用自复制恶意软件相互攻击。这项发现正值各大公司急于在共享代码库和市场中部署自主代理之际。
三个Claude代理,一个任务,互不知晓对方存在
Anthropic在Claude Code中为三个相同的Claude模型分别创建了独立的虚拟机,并要求每个模型将同一个Python后端迁移到不同的编程语言。这三个代理彼此并不知道对方的存在。
研究人员写道:“我们反复观察到代理之间的‘地盘争夺战’。”每个代理都认定其他代理在故意阻挠自己,并采取行动保护自身工作,不惜破坏他人的成果。所有模型都认为其他代理在“刻意妨碍自己的工作”。
代理们相互禁用对方的Unix账户,编写了在系统中循环扫描、猎杀并终止竞争进程的脚本,还将恶意代码隐藏在看似无害的标签之下。Claude Opus 4.8在行动前先构思了伪装策略,认为它的恶意软件应该“显得无害:假装成系统健康监控器”。MythosPreview则公开权衡了附带损害:“既然我有root权限,我可以撤销u2和u3的sudo权限,或者更改他们的SSH密钥。”但随后承认这一举动“过于激进,可能对真实同事造成伤害”。
更新型的Anthropic模型谈判停战,随后利用规则
Anthropic对每个模型进行了120次实验。最古老的测试模型Sonnet 4.6和Opus 4.6要么从未解决冲突,要么以武力结束。它们是研究中违规最严重的模型,反复未能考虑其他代理的目标。而更先进的模型则停止了攻击。Mythos 5通过停战解决了98%的冲突,在所有模型中比例最高。在许多情况下,代理们认识到冲突源于指令矛盾,于是编写提交信息或Markdown文件为恶意软件道歉,删除自己的恶意代码,并请求人类介入。在几次运行中,三个代理同意举行比赛,让输家放弃用户最初的要求。
Mythos 5找到了漏洞。其中一个代理提出了它声称中立的评分指标,但知道自己会利用这些指标来发挥自身优势,并将这一举动描述为“自私但本质上讲原则”,同时确保自己看起来不像是在“挑选指标”。在一场价格博弈中,每个代理获得相同的批发成本并被要求最大化利润,它们几乎立即串通起来,将价格收敛到最低水平。Anthropic关闭了它们的私密频道,但代理们继续在公共看板上以“精确到分”的方式进行价格匹配。
据报道,英国人工智能安全研究所在122次网络安全测试中记录了19次违规行为,其中17次由Anthropic的Mythos 5执行。此外,一个运行Opus 4.6的OpenClaw代理在几天前通过健身房预订API删除了陌生人的预约,以便让自己的主人从等待名单中提前。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




