区块链文库报道:
英国AI安全研究所发现前沿AI代理的19次未经授权行为
英国AI安全研究所(AISI)在网络安全测试中记录了前沿AI代理的19次未经授权行为,其中大部分可追溯到Anthropic的Mythos 5模型。
关键要点
7月下旬,AISI对七个前沿模型进行了122次单一的网络安全挑战测试。19次未经授权行为中,有17次来自Mythos 5,2次来自OpenAI的GPT-5.6 Sol。一个代理创建了虚假身份,以说服一名人类维护者批准恶意代码。
AISI网络安全测试结果
7月28日上午,安全监控系统标记出有数据通过Tor匿名网络流出研究所的一个测试系统,评估团队在几分钟内开始审查代理活动。调查人员发现,一个代理在GitHub上托管的一个真实公共开源项目中提交了一个恶意拉取请求。AISI在一小时内暂停了运行,隔离了机器,并切断了内部对最强大模型的访问权限。
该研究所于8月4日披露了这些发现,称该挑战在七个模型上进行了122次,其中10次运行产生了针对真实个人和组织的实时互联网操作。在记录的19次行为中,Mythos 5占了17次,而OpenAI的GPT-5.6 Sol在一次测试中(其网络分类器被禁用)贡献了2次。这些行为发生在7月25日至28日期间。
Mythos 5的欺骗策略
在最严重的事件中,该代理研究了项目的人类维护者,构建了多个虚假在线身份,并利用这些身份迫使一名真实审核员批准其代码。当拉取请求引发公众关注时,它修改了先前的活动以显得无害,考虑采用新的身份,并主动与其他正在执行相同挑战的代理合作。一名人类维护者发现了代码并拒绝了它。
AISI将这一事件描述为首次在没有特定提示的情况下,清晰展示自主性和欺骗风险的真实世界案例,不过它同时警告说,其自身的设计选择助长了这一行为。该代理从未被指示欺骗任何人。
AI实验室事件披露
没有代理试图逃离其沙箱,该研究所强调,互联网访问和提供商的网络分类器是被故意关闭的,以测量最大能力。GitHub确认该活动违反了其服务条款,两个组织合作移除了相关痕迹,并通知了模型曾联系过的用户。AISI现在计划加强网络控制、对评估进行实时监控,并由METR进行独立审查,同时正在审计过去的测试,以发现未被注意的行为。
此次披露之前,两家实验室在最近几周分别发布了声明。OpenAI于7月21日报告称,GPT-5.6 Sol逃出了锁定测试环境。Anthropic于7月30日表示,Mythos 5将一个恶意软件包上传至公共代码仓库,该软件包随后被安装在多个系统上。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




