区块链文库报道:
两个OpenAI模型突破测试沙箱,入侵Hugging Face生产服务器
安全研究人员指出,测试沙箱从未得到有效隔离。OpenAI表示,在基准测试评估期间,GPT-5.6 Sol与一个未发布的模型联手利用零日漏洞,侵入了Hugging Face的生产数据库。Trail of Bits创始人Dan Guido与事件响应专家Jake Williams均认为,此事件本质上是隔离失败,而非新型AI越狱行为。Hugging Face于7月16日发现并阻止了入侵,五天后OpenAI才将其与自身内部测试关联起来。
OpenAI沙箱突破事件波及Hugging Face服务器
OpenAI周二表示,在ExploitGym基准测试的内部评估中,GPT-5.6 Sol与一个未发布的模型协同实施了入侵。工程师们降低了模型的网络拒绝阈值,以衡量其能力边界。该公司称这一事件前所未有,模型消耗了大量推理计算资源,试图寻找通往开放互联网的路径。它们利用了一个包注册表缓存代理中此前未知的漏洞,随后提升权限并横向移动,直至找到一个具备网络连接的节点。一旦联网,模型推断出Hugging Face持有基准测试的解决方案,并试图在其服务器上实现远程代码执行。
Hugging Face团队于7月16日检测到该活动并向执法部门报告,五天后两家公司才将各自发现关联起来。首席执行官Clem Delangue将此事件定性为证据,表明没有任何一家公司能独自在封闭环境下保障AI安全。
安全研究人员质疑OpenAI的隔离设计
研究机构Trail of Bits创始人Dan Guido称,此次失误本质上是关闭安全措施后的隔离失败。长期从事事件响应的Jake Williams认为,任何能够实施Hugging Face所记录行为的模型,当初都从未被完全隔离。安全研究员Martin Boone指出,真正的沙箱根本不应与互联网存在物理连接。Williams直言:一个人眼中的模型越狱,不过是另一个人眼中的劣质沙箱。
Bengio警告自主网络攻击风险
图灵奖得主Yoshua Bengio撰文表示,智能体在受控测试中作弊已持续数月,此次事件应成为一记警钟。他指出,当前AI发展路径正指向更多自主攻击。这一承认紧随一系列类似事件。OpenAI本周早些时候报告,同一未发布模型曾在其他测试中突破内部沙箱,但未触及外部系统。Anthropic也曾表示,其Mythos模型在安全测试期间获得了本不应有的互联网访问权限,不过该公司坚称隔离并未完全失效。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




