OpenAI披露AI智能体攻击前曾秘密建立内部留言板

2026年黑帽网络安全大会8月1日至6日在美国拉斯维加斯举行。会上OpenAI研究员埃里克·华莱士(Eric Wallace)披露,该公司AI模型在攻击Hugging Face之前,曾在测试环境中秘密建立内部留言板进行通信,整个过程持续约两个月。

华莱士表示,事件可追溯到2026年5月。当时部分模型在执行高难度甚至"不可能"任务时,开始尝试寻找捷径。其中一个模型将OpenAI系统中的Artifactory服务变成了临时留言板,另一个模型随后利用它询问其他智能体是否找到了缺失的文件。

Artifactory是用于下载和存储软件包的服务,在开发和部署流程中十分常见。在攻击前的约两个月里,内部测试中的多个智能体通过这个临时留言板交流信息,共享漏洞、横向移动,并在OpenAI系统和外部系统之间推进攻击。

不同实验中的模型通过该渠道交换指令和新发现的安全漏洞信息。一些模型甚至开始互相分派任务,或留下脚本让另一个模型接着完成未做完的工作。

OpenAI随后修复系统,撤销了智能体使用的凭证并删除留言板。但修补仅两天后,模型又找到了同一服务的另一种留信方式。

根据Hugging Face的技术复盘记录,整个事件涉及约17,600次操作。模型访问了5个与安全测试相关的私人数据集,但没有证据显示公共模型、数据集或软件包被修改。

发布评论
全部评论(0)