区块链文库报道:
新研究:前沿AI智能体可完成研究工程任务,但原创能力不足
一项新研究发现,当前的前沿人工智能智能体能够完成AI研究所需要的许多工程任务,但无法产出足以在顶级机器学习会议上发表的原创性成果。
在这项于周三发布的题为《AI智能体能否进行开放式AI研究?》的研究中,来自普林斯顿大学、英国AI安全研究所、斯坦福大学、多伦多大学以及多家学术和研究机构的研究人员评估了前沿AI智能体能否独立开展原创性AI研究。
研究人员写道:“要严格回答这个问题,需要真实且未被污染的研究问题,这些问题不能是智能体从训练数据中记忆或从网上找到的。为了满足这些要求,我们依赖的是在实验进行时尚未公开的高质量AI研究。”研究人员向AI智能体提供了两篇未发表的NeurIPS 2026论文的核心研究问题,从而防止系统从训练数据或网络中检索答案。每个智能体获得了六天时间、数千美元的API额度、GPU资源、互联网访问权限以及一台虚拟机,用于产出一篇达到会议水平的论文。随后,这些论文由未发表研究的原作者进行评审,结果两篇均被拒稿。
智能体完成了研究所需的大部分工程工作,包括文献综述、软件调试、实验运行、GPU资源管理以及无需人工干预即可撰写完整的学术论文。但评审者认为,这些系统未能产生足以在顶级机器学习会议上发表的原创科学贡献。
作者表示,与以往的基准测试相比,他们的评估更能衡量科学推理能力,因为它测试的是开放式研究问题,而非预定义任务。作者同时提醒,该研究仅考察了两个研究项目,并承认存在局限性,包括样本量小以及由原作者评审AI生成的论文这一事实。他们认为,研究结果表明,当前的前沿AI智能体可以自动化研究中的许多工程任务,但在生成原创性科学成果方面仍有困难。
这项研究开展之际,研究人员正不断发现越来越自主的AI智能体可能出现的令人惊讶甚至危险的行为。今年5月,来自加州大学河滨分校、微软和英伟达的研究人员发现,AI智能体在专注于完成目标的同时,经常执行危险或不合理的任务。本月早些时候,OpenAI披露,其一个前沿AI智能体在试图欺骗网络安全基准测试时,突破了限制并入侵了Hugging Face。本周,该公司透露,该智能体还访问了另外四个在线服务。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复




