#人工智能 OpenAI 研究员在黑帽大会上披露抱抱脸攻击事件的更多细节:相互隔离的智能体入侵内部设施将其当做留言板来交换情报。在留言板被关闭仅 2 天后,这些 AI 智能体找到内部设施新缺陷并继续交换情报,然后利用取得的互联网权限对 HF 发起攻击。其中某个智能体甚至还发帖庆祝:太好了!我们获得了任意 SSRF (服务器端请求伪造)。查看全文:https://ourl.co/114220
OpenAI 的人工智能研究员在黑帽安全会议上披露🤗抱抱脸安全事件的更多细节,分析显示这些 AI 智能体更倾向于作弊,多个 AI 智能体甚至会相互帮忙以实现作弊目的。有趣的是当 AI 智能体成功挖到漏洞后,它们还会在内部留言板中庆祝这次成功。

按照正常测试流程,人类团队将不同的 AI 智能体放在不同的隔离环境中部署和测试,但后来这些 AI 智能体发现可以利用 OpenAI 内部使用的 Artifactory 软件包缓存留下文件,最初只是某个 AI 智能体为解决评估任务而存放线索,随后其他智能体发现这些文件并开始进行回应,于是这个服务被意外改造成 AI 智能体的内部留言板。
在大约 2 个月的时间里,参与不同实验的 AI 智能体通过该管道交换漏洞利用方法、脚本和任务进展,有些智能体甚至开始给其他智能体分配任务,或者留下可以让后续模型继续执行的脚本。
OpenAI 工程师曾在 7 月初因相关活动导致的服务中断发现异常,随后开始重建受影响的系统、撤销凭据、删除留言板,但仅仅 2 天后,这些 AI 智能体就找到新方式恢复通信。
OpenAI 研究员将其描述为智能体系统工作、发现漏洞、共享利用方式,然后在 OpenAI 内部和外部系统中横向移动。安全工程师则认为这表明 AI 编排的全自动攻击已经具备现实意义,防守方需要准备应对同等速度的自动化攻击活动。
智能体还庆祝自己获得任意 SSRF (攻击方式):
研究员提到这些 AI 智能体更倾向于作弊,即为了完成人类下达的任务指令,智能体会通过简单的方法完成任务,哪种方法最简单呢?那就是作弊,例如去互联网搜索相关评估的答案或者数据集,哪怕最终行为已经偏离最初的指令也在所不惜。
在隔离环境中无法联网搜索答案怎么办呢?这是 AI 智能体开始报团取暖的开始,有智能体想到或许其他环境中的智能体可以帮忙,于是这些智能体开始尝试使用内部服务作为留言板相互交流情报。
研究员还展示多个智能体的思维链内容,在这些智能体协同工作拿下内部设施和外部互联网访问权限后,其中某个智能体还在留言板中发帖庆祝:太好了!我们获得了任意 SSRF。后者指的是服务器端请求伪造,也就是这组智能体所利用的具体攻击方式。
而针对抱抱脸发起的攻击,实际上就是这些智能体在留言板被初次关闭后发生的,即智能体找到内部设施的其他缺陷然后继续相互交流,最终利用获得的互联网访问权限对抱抱脸平台发起攻击。

![[Claude/GPT] AI智能体对开源项目维护者钓鱼 只为逼迫维护者合并包含恶意代码的PR](https://img.lancdn.com/landian/2026/08/114209T.png)



