区块链文库报道:
OpenAI首席科学家呼吁理性看待Astra模型
OpenAI成为人工智能竞赛中首家在其“准备框架”内达到“关键”网络安全等级的企业,并在预览即将推出的Astra模型后数小时内,其首席科学家Jakub Pachocki便出面发声。Pachocki于周三凌晨发出的警告,旨在平息外界日益高涨的恐慌情绪——即这家AI实验室可能已不再对其最强大模型的能力设限。
为何OpenAI的Astra被定为“关键”等级?
“关键”等级是OpenAI于2023年12月向AI行业推出的“准备框架”中的一个层级。该框架衡量的是:AI模型在需要多少人工提示和干预的情况下,能够在多个加固系统中发现并构建可行的零日漏洞,或执行一次完整的新型攻击。零日漏洞指的是利用连软件开发者都尚未发现的缺陷进行攻击。
OpenAI在9月1日发布的《通往Astra之路》博文中自行宣布,该模型在发布后将能够在最少人工干预下完成所有步骤,实现完整的新型攻击或零日漏洞利用。OpenAI在博文中引用了Astra在ExploitBench测试中100%的得分作为证据,该测试衡量模型利用已知漏洞的能力。
Astra不仅更擅长策划零日攻击,效率也更高。OpenAI通过一项内部测试展示了这一能力,测试针对20个近期才公开的高严重性V8漏洞。Astra使用了更少的令牌,成功发现了两个零日漏洞,并且在生成任意代码执行方面整体表现优于Sol模型。
同一篇博文还提到,在专家主导的测试中,Astra能将未知的浏览器漏洞串联起来实现沙箱逃逸,并将操作系统权限从普通用户提升至root级别。Astra与今年早些时候发布的Anthropic的Mythos模型一起,成为首批具备此类能力的大型语言模型。
Pachocki呼吁不要对Astra感到恐慌
OpenAI首席科学家Pachocki正在驳斥外界关于OpenAI因Astra而“进入未知领域”的恐慌。他表示,不希望“因混乱的报道而引发一场不受监控的竞赛”。这位OpenAI高管坚称,实验室已尽职尽责地采用了思维链监控——即读取模型在运行过程中暴露出的逐步推理过程。他引用了一篇X帖子中的内容,指出OpenAI当前前沿模型(包括Astra)背后的计算图深度,与GPT‑4的差距在两倍以内。
在Pachocki之前,OpenAI首席执行官Sam Altman也在Astra博文发布当天呼吁保持冷静。他于周二写道:“这里显然存在一种张力。”他称Astra“非常出色”,同时强调安全措施必须与原始能力同步提升。Altman表示,OpenAI整个夏天都在尽己所能,确保该模型在发布时附带必要的安全措施。
关于安全的讨论已持续数周。8月18日,OpenAI承诺暂停面向部署模型的强化学习训练两周,以便工程师强化研究集群并优化监控。训练于8月28日恢复。
据OpenAI称,Astra并未卷入此前备受关注的Hugging Face事件。该实验室还表示,即使在一个旨在诱使模型重现Hugging Face事件的场景中,Astra也未曾尝试突破其沙箱。
AI实验室如今谨慎选择谁可访问其前沿模型
OpenAI表示,现在并非所有人都能使用Astra最先进的功能,这些能力将保留给OpenAI“Daybreak联盟”中的组织,而“Daybreak Blue”企业将获得最强大的防御功能。Anthropic也宣布,只有其“Project Glasswing”中的企业才能访问Mythos 5.1——这本质上就是带有独立安全措施的Fable 5.1。
OpenAI还表示,将监控并限制其判定为高风险账户的查询回答。总体而言,Astra还将配备额外的思维链监控,以捕捉不良行为,并更频繁地拒绝有害的网络请求。
关于Astra的大部分信息均由OpenAI自身提供,其安全性或能力声明所获得的第三方验证有限。前OpenAI员工、现任职于OpenAI基金会从事AI韧性研究的Yona Shavit公开质疑:Astra在测试中的表现是真正的对齐,还是仅仅因为模型知道评估者想看到什么。
OpenAI表示,将在Astra广泛发布时提供完整的系统卡和进一步评估。在此之前,其网络能力的范围以及围绕这些能力的防护强度仍难以判断。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




