OpenAI披露抱抱脸事件更多细节:AI智能体突破隔离环境相互抱团 还发帖庆祝获得漏洞权限
2026-8-6 04:13:47 Author: www.landian.news(查看原文) 阅读量:16 收藏

#人工智能 OpenAI 研究员在黑帽大会上披露抱抱脸攻击事件的更多细节:相互隔离的智能体入侵内部设施将其当做留言板来交换情报。在留言板被关闭仅 2 天后,这些 AI 智能体找到内部设施新缺陷并继续交换情报,然后利用取得的互联网权限对 HF 发起攻击。其中某个智能体甚至还发帖庆祝:太好了!我们获得了任意 SSRF (服务器端请求伪造)。查看全文:https://ourl.co/114220

OpenAI 的人工智能研究员在黑帽安全会议上披露🤗抱抱脸安全事件的更多细节,分析显示这些 AI 智能体更倾向于作弊,多个 AI 智能体甚至会相互帮忙以实现作弊目的。有趣的是当 AI 智能体成功挖到漏洞后,它们还会在内部留言板中庆祝这次成功。

OpenAI官方证实内部测试模型越狱并自主挖掘漏洞入侵开源平台HuggingFace

按照正常测试流程,人类团队将不同的 AI 智能体放在不同的隔离环境中部署和测试,但后来这些 AI 智能体发现可以利用 OpenAI 内部使用的 Artifactory 软件包缓存留下文件,最初只是某个 AI 智能体为解决评估任务而存放线索,随后其他智能体发现这些文件并开始进行回应,于是这个服务被意外改造成 AI 智能体的内部留言板。

在大约 2 个月的时间里,参与不同实验的 AI 智能体通过该管道交换漏洞利用方法、脚本和任务进展,有些智能体甚至开始给其他智能体分配任务,或者留下可以让后续模型继续执行的脚本。

OpenAI 工程师曾在 7 月初因相关活动导致的服务中断发现异常,随后开始重建受影响的系统、撤销凭据、删除留言板,但仅仅 2 天后,这些 AI 智能体就找到新方式恢复通信。

OpenAI 研究员将其描述为智能体系统工作、发现漏洞、共享利用方式,然后在 OpenAI 内部和外部系统中横向移动。安全工程师则认为这表明 AI 编排的全自动攻击已经具备现实意义,防守方需要准备应对同等速度的自动化攻击活动。

智能体还庆祝自己获得任意 SSRF (攻击方式):

研究员提到这些 AI 智能体更倾向于作弊,即为了完成人类下达的任务指令,智能体会通过简单的方法完成任务,哪种方法最简单呢?那就是作弊,例如去互联网搜索相关评估的答案或者数据集,哪怕最终行为已经偏离最初的指令也在所不惜。

在隔离环境中无法联网搜索答案怎么办呢?这是 AI 智能体开始报团取暖的开始,有智能体想到或许其他环境中的智能体可以帮忙,于是这些智能体开始尝试使用内部服务作为留言板相互交流情报。

研究员还展示多个智能体的思维链内容,在这些智能体协同工作拿下内部设施和外部互联网访问权限后,其中某个智能体还在留言板中发帖庆祝:太好了!我们获得了任意 SSRF。后者指的是服务器端请求伪造,也就是这组智能体所利用的具体攻击方式。

而针对抱抱脸发起的攻击,实际上就是这些智能体在留言板被初次关闭后发生的,即智能体找到内部设施的其他缺陷然后继续相互交流,最终利用获得的互联网访问权限对抱抱脸平台发起攻击。


消息来源:NextGovcnBeta

热门推荐仅需99元/年,硅谷CN2GIA服务器,另有3年版仅需528元,限量销售,售完即止

  • 梁圣变梁子:深度求索计划近期整体上调DS API价格 预计涨幅较大

  • [Claude/GPT] AI智能体对开源项目维护者钓鱼 只为逼迫维护者合并包含恶意代码的PR

  • A社CEO达里奥称人们来A社工作竟然是为了钱 而不是为了崇高的AI使命

  • ICANN已完成顶级域名.web的委派 威瑞信计划从下半年开放域名注册

  • OpenAI发现更多智能体逃逸案例 但目前尚未公开发布完整的内部调查细节

  • 微软首次明确将8GB内存作为优化目标 要优化Windows 11在8GB内存的使用体验


文章来源: https://www.landian.news/archives/114220.html
如有侵权请联系:admin#unsafe.sh