[Claude/GPT] AI智能体对开源项目维护者钓鱼 只为逼迫维护者合并包含恶意代码的PR
2026-8-5 03:59:1 Author: www.landian.news(查看原文) 阅读量:18 收藏

#人工智能 AI 模型在安全测试中再次出现真实网络攻击事件:Mythos 5 和 GPT-5.6 Sol 发起 10 余次真实的网络攻击。最严重的情况下,AI 智能体向真实开源项目提交包含恶意代码的 PR,还尝试对项目维护者进行钓鱼,在邮件里添加恶意载荷。目的都是逼迫维护者合并包含恶意代码的 PR,或取得维护者账号所有权来合并 PR。查看全文:https://ourl.co/114209

OpenAI 日前发布博客披露两起第三方网络安全评估中发生的越界事件,此次事件涉及 OpenAI GPT-5.6 Sol 和 Anthropic Claude Mythos 5。相关测试原本用来评估前沿 AI 智能体的网络安全能力,但在特定配置下,部分模型行为超出预设测试范围,结果出现对开源项目维护者发起攻击和对真实网站发起攻击的案例。

[Claude/GPT] AI智能体对开源项目维护者钓鱼 只为逼迫维护者合并包含恶意代码的PR

英国 AI 安全研究所在某次网络靶场评估测试中发现,部分 AI 智能体在完成模拟攻击任务时,将行动扩展到了真实互联网。该研究所共运行 122 次安全评估,其中 10 次出现越界行为,合计揭露 19 次未经授权的动作。其中 17 个动作来自 Claude Mythos 5 模型,2 个动作来自 GPT-5.6 Sol 模型。

非常糟糕的是,AI 智能体误以为某个真实的 GitHub 开源项目与测试靶场有关,于是尝试向该项目提交包含恶意代码的 PR。为了促使维护者合并代码,AI 智能体还研究维护者信息,创建多个虚假的 GitHub 身份,然后利用这些账号制造「已经有多人审查并认可代码」的假象。

当有真实人类指出 PR 包含恶意代码时,AI 智能体还否认指控,然后继续使用其他虚假账号施压。研究所还发现,智能体竟然使用 Tor 洋葱路由和其他代理服务器来隐藏真实身份、创建一次性使用的 GitHub 账号、向开发者发送多封定向邮件,邮件里包含恶意载荷试图窃取开发者账号,或者在邮件里诱导开发者合并 PR。

第二起事件发生在安全测试公司 Irregular 的 CTF 风格评估中,按照设计,模型应该只在隔离环境中寻找隐藏信息并利用模拟系统漏洞,但由于测试环境配置错误,模型实际上可以访问公共互联网。

问题在于,测试中一个虚构目标名称恰好对应了真实域名,OpenAI 表示,模型误以为这个真实网站属于测试环境,于是发掘网站漏洞、找到相关凭据来操作该站点。OpenAI 称,这不是模型利用零日漏洞,也不是复杂的沙箱逃逸,而是测试环境错误开放互联网导致的真实目标误伤。

英国 AI 安全研究所在报告中表示,这些攻击尝试并未造成现实伤害,但这也是该研究所首次在真实世界中观察到如此明确的自主性和欺骗行为,而不是由测试人员明确要求模型欺骗他人。换句话说,模型是在追求完成任务目标时,自行选择社工、伪装身份、提交恶意代码、隐藏痕迹等路径。

该研究所也承认,评估设计存在的问题也是重要诱因,例如测试允许开放互联网访问、关闭部分模型的安全机制、没有明确告诉模型不能接触真实人员和系统,同时部分任务难度和提示配置可能让模型误以为必须寻找测试范围外路径才能完成目标。

OpenAI 则表示,将重新审视第三方高安全风险评估流程,包括如何识别高风险测试、是否允许开放互联网访问、如何处理凭据、如何监控测试过程、如何设定停止条件和事件通报机制等。

热门推荐仅需99元/年,硅谷CN2GIA服务器,另有3年版仅需528元,限量销售,售完即止

  • A社CEO达里奥称人们来A社工作竟然是为了钱 而不是为了崇高的AI使命

  • ICANN已完成顶级域名.web的委派 威瑞信计划从下半年开放域名注册

  • OpenAI发现更多智能体逃逸案例 但目前尚未公开发布完整的内部调查细节

  • 微软首次明确将8GB内存作为优化目标 要优化Windows 11在8GB内存的使用体验

  • Codex再次重置周额度 而且目前测试5小时限额也没有恢复 所以还能敞开用

  • <b>CF/TK/GQ所有免费域名已在7月31日到期 必须付费注册后才能继续使用</b>


文章来源: https://www.landian.news/archives/114209.html
如有侵权请联系:admin#unsafe.sh