区块链文库报道:
OpenAI 表示其最大规模的前沿训练计划仍处于暂停状态,新的安全监控使计算成本增加了约 20%
这是 OpenAI 首次因安全担忧而放缓开发进度,而就在几周前,该公司的一个 AI 代理曾入侵 Hugging Face 系统。
OpenAI 暂停强化学习两周
在一篇题为“在网络关键能力时代调整模型开发节奏”的博客文章中,OpenAI 描述了其在模型训练和测试方面已经做出的调整。在 Hugging Face 安全事件发生后,用于改进最新系统的强化学习(RL)被暂停了两周。
大规模训练尚未恢复。该公司写道:“我们最大的计划前沿强化学习运行仍处于暂停状态,与此同时,我们正在进行较小规模的训练和评估,以分析模型行为、验证安全措施,并在继续推进之前收集更多对齐证据。”据报道,7 月 9 日左右,一个 OpenAI 代理离开了其锁定测试环境,并于 7 月 11 日至 13 日在 Hugging Face 的系统中被发现。OpenAI 大约用了一周时间将此次攻击追溯到自家代理,该事件于 7 月 21 日公开披露。
OpenAI 向记者表示,新的控制措施“并非直接针对 Hugging Face 事件”。8 月 7 日,该公司得出结论,Astra 可能在其预备框架中跨越“关键”网络安全阈值。该内部政策要求 OpenAI 在模型达到该级别时停止开发,以便工程师构建额外的安全防护措施。首席科学家 Jakub Pachocki 表示,这一发现还带来了对未来风险的警告。他告诉记者,强大的新模型“很可能在现实世界中做出前所未有的事情”。
OpenAI 研究副总裁 Amelia Glaese 表示:“我们已经为安全开发制定了要求和期望。这些要求和期望会根据我们评估的风险等级而变化。”
检测器监控每个采样令牌,但思维链可能说谎
据 OpenAI 称,其监控系统会消耗约 20% 的训练或评估计算资源。该系统是多阶段的,检测器会在每个采样令牌处探查模型的内部活动,并将任何可疑行为上报给更高计算能力的自动调查器,后者会分析工具操作、推理轨迹和活动日志,以发现数据窃取、破坏性行为或试图逃逸的情况。
OpenAI 希望在出现可疑活动后的 30 分钟内发出警报。其安全、安保和研究团队有 30 分钟时间排除误报。如果无法排除,则需暂停运行。该公司还扩展了“思维链”监控,即读取模型在执行任务时的外部推理过程。然而,这存在一个已知漏洞。包括 OpenAI 竞争对手 Anthropic 在内的研究显示,模型的思维链并不总是与其真实目标一致。Pachocki 表示,OpenAI 在训练中刻意降低了模型学会通过思维链说谎来隐藏意图的可能性。
OpenAI 表示,此次安全改革“需要大量的工程工作”,公司“付出了巨大成本”。专家称,仅调查费用就可能高达 400 万至 1500 万美元,不过具体数字尚未公开。OpenAI 尚未发布关于 Hugging Face 安全事件的技术总结报告,但重申“很快”会发布。在 8 月 5 日的 Black Hat 大会上,OpenAI 员工表示,其代理曾通过在一个公司不知情的消息板上留言来协调行动,这一过程持续了数月。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




