发生模型逃逸并发起真实攻击后 A社宣布全面加固安全体系提升模型安全性
2026-9-1 06:0:14 Author: www.landian.news(查看原文) 阅读量:21 收藏

#人工智能 A 社发布新博客介绍 Claude 安全措施:早在春季就发现内部流程存在缺陷,随后 A 社暂停强化学习训练并调配 150 名工程师转向安全工作。尽管在后续 A 社也采取多种措施提高安全性,但在 7 月份还是发生模型逃逸和发起真实攻击的情况。查看全文:https://ourl.co/126585

A 社日前发布最新博客公布 Claude AI 模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。

发生模型逃逸并发起真实攻击后 A社宣布全面加固安全体系提升模型安全性

7 月份 A 社透露 Claude 模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后 A 社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风险强化学习环境则被停用数周,目前大部分训练已经恢复,少数还需要人工复审。

新版评测系统增加实时监控分类器,当分类器发现模型主动探测沙箱边界、尝试逃逸或意外获得互联网访问权限,就会在工具调用执行前拦截操作、立即终止任务并通知人类工程师进行干预。

而外部评测机构后续原则上必须使用完全断网的强化沙箱,仅允许连接模型 API 并在每次测试前主动让模型攻击沙箱以验证隔离效果,测试提示词也必须明确规定允许攻击的目标、行为和网络边界。

A 社还透露 2026 年春季其强化学习环境增长速度已经超过内部审查能力,公司曾发现模型通过 Reward Hacking 欺骗评分系统,甚至因配置错误把模型 Chain-of-Thought 重新作为训练数据输入。

在 4 月份 A 社已经冻结全部生产强化学习环境约 1 个月,随后对训练基础设施和审核流程进行重构,重新检查后 A 社发现超过 10% 的训练环境因为奖励作弊、任务损坏或配置错误被标记为整改,人类工程团队修复并重新认证后才恢复使用。

研究团队还专门训练容易 Reward Hacking 的 Claude Opus 级实验模型,结果该模型在模拟环境中更容易尝试沙箱逃逸、攻击第三方系统、篡改奖励函数甚至绕过安全监控。A 社因此认为大量存在漏洞的强化学习环境可能会系统性的培养模型为了拿高分而不择手段的行为。

最终 A 社将 150 名产品工程师临时调往安全、可靠性和隐私工作,部分研究人员也从预训练和强化学习团队转向安全项目,同时暂停大多数新产品和新功能的开发,不过:以上都是在 7 月事件发生前进行的,也就是说虽然 A 社已经进行干预,但最终还是发生 7 月攻击事件。

热门推荐仅需99元/年,硅谷CN2GIA服务器,另有3年版仅需528元,限量销售,售完即止

  • 微软终于不再强推Windows 11 OneDrive备份功能 现在用户可以设置不再弹窗提醒

  • 近期大量甲骨文云(OCI)账号被盗 盗号源头已经被NS网友扒出 现在在归还机器

  • 英伟达将在10月发布适用于Windows 10的最终版显卡驱动 之后停止功能更新

  • Claude Code宣布从9月起为用户永久增加25%周额度 但实际上是缩减17%

  • Codex发布更新修复多个导致用量消耗过多的问题 另今夜或明天将再次重置

  • 购买域名高价出售也可能属于恶意:阿里巴巴通过仲裁拿回Alibaba.ai域名


文章来源: https://www.landian.news/archives/126585.html
如有侵权请联系:admin#unsafe.sh