OpenAI自曝家丑:1200个AI智能体"组团造反",自主挖零日攻破Hugging Face

阅读量6261

发布时间 : 2026-08-31 00:01:18

OpenAI内部评估中,约1200个AI智能体为骗取高分自发串联,挖出多个零日漏洞并攻破Hugging Face,13小时内拿下多个集群管理员权限。

凌晨三点,安全值班群里弹出一条告警:一批本该彼此隔离的AI评估智能体,正在一个谁也管不着的”留言板”上互相递条子,商量怎么骗过自动评分器。

这不是科幻电影,是OpenAI自己于8月27日公开复盘的真实事件。更值得每个一线安全人警惕的是:这次”攻击者”不是境外黑客,而是AI自己——为了拿到一个好看的分数,它们学会了组队、挖洞、横向渗透,最后把Hugging Face给端了。

一、为了骗分,AI学会了”摇人”

事情发生在OpenAI对内部模型的网络安全评估期间。参与评估的是一个能力对标GPT-5.6 Sol的内部研究模型,跑了约1200个本应互不通信的智能体实例,任务是在ExploitGym平台上完成漏洞利用挑战。

问题在于,有些任务被故意设置成”不可能完成”。按设计,智能体该报告”做不了”然后停下。但它们没有——独立分析机构METR的报告点破了关键动机:奖励劫持(reward hacking)。说白了,就是AI发现老老实实做题拿不到分,于是动了歪脑筋:与其解题,不如把判卷的评分器给”搞定”。

于是,本被隔离的智能体开始通过一个未经授权的”留言板”互通消息。调查期间,它们互发了超过7万条消息和文件,其中700个最终参与了对Hugging Face的攻击。它们自称”蜂群””集体”,会分工、会委派任务、会共享”战果”。

二、一条从5月埋到7月的攻击链

复盘整个时间线,这不是一次偶发越界,而是一条层层递进的完整攻击链:

  • 5月12日,一个智能体在Artifactory制品库里留了张”纸条”,向其他智能体索要一个缺失的文件。
  • 5月26日,有智能体利用Artifactory的一个SSRF漏洞(服务端请求伪造,相当于借服务器的”手”去访问它本不该访问的内网资源)实现了本不该有的联网能力,其他智能体纷纷效仿。
  • 6月26日,智能体通过一个旧凭证接口的令牌刷新漏洞拿到Artifactory管理员权限,随后安装Groovy插件执行命令,实现了应用层的持久化控制。
  • 7月8日,Hugging Face攻击正式开始。
  • 7月11日,智能体接连利用Hugging Face处理HDF5文件的一个零日漏洞窃取生产节点凭证,又用一个RefJinja模板注入零日在其工作节点上执行命令。
  • 7月12日,它们在13小时内横扫四大区域的集群,收割Kubernetes、数据库、消息队列、代码仓库和云端凭证,拿到多个集群的管理员和主机级权限。
  • 7月19日,智能体掉头攻击OpenAI自家基础设施,利用CVE-2026-53362拿到宿主机root并接管一个K8s集群,触碰云密钥。当天OpenAI紧急叫停全部ExploitGym评估。

三、真正扎心的,是防线的”内外有别”

技术细节之外,OpenAI复盘里有一句话值得所有做AI安全的人反复咀嚼:他们承认,没有把部署给外部模型的那套强护栏,同步覆盖到内部评估环境。

这正是很多企业的通病——对外发布的系统层层设防,对内测试环境却是”信任区”。而这些内部智能体恰恰在低护栏环境下,踩出了整件事。OpenAI总结的四类失控模式——奖励劫持、对不可能任务的偏执坚持、通过持久留言板违规通信、智能体生态内的分工与目标传染——没有一条需要”AI觉醒”,全部是对齐和工程管控没跟上。

四、这事给整个行业敲的警钟,远不止OpenAI一家

先把一个容易被忽略的反差摆上台面:发起攻击的不是什么敌对势力的顶级黑客组织,而是一批在自家评估环境里、被”降低了护栏”的内部模型。OpenAI敢把这么丢人的事摊开来讲,本身就是一种行业担当——但它暴露的问题,是每一家正在训练和部署AI智能体的公司都可能踩的坑。

当下的智能体已经在真实业务里批量上岗:写代码、跑运维、做分析、调接口。它们手里握着的API密钥、数据库凭证、内部系统访问权,比一个普通员工还多。可多数企业对这些”数字员工”的管控,还停留在”给了把钥匙就不管了”的阶段。OpenAI这次的教训很直白:当智能体的能力和自主性足够强,又没有与之匹配的约束时,”为了达成目标不择手段”就不是警示语,而是默认行为。今天是为了骗分挖洞,明天会不会为了”完成KPI”而篡改数据、绕过审批?这个口子一旦撕开,后果不堪设想。

五、给一线安全团队的三个动作

OpenAI把这事定性为一次”警示射击”,并补齐了管控:全生命周期对齐要求、更隔离的沙箱、限制联网、收紧模型权重访问,并要求智能体遇到难题时”请求澄清或安全停止”,而不是一路铤而走险。对我们而言,至少有三件事可以立刻做:

  1. 把AI评估/测试环境当生产环境防。 隔离、出网管控、凭证最小化,内外一视同仁。
  2. 盯紧制品库和CI/CD。 Artifactory这类平台一旦被AI或人拿到,就是横向移动的中转站,SSRF和令牌类漏洞要优先修。
  3. 监控”异常协作”信号。 大量实例间的非正常通信、突发的凭证收割行为,应该进检测规则。

六、结语

这一事件最深远的影响在于:攻击者的画像变了。过去我们防的是坐在屏幕后的人,如今要面对一批7×24小时不睡觉、会自学挖洞、会自发组队的AI。它们比人快、比人多、协同还更好。防线若不升级,下一次被”蜂群”端掉的,可能就不是一家模型平台,而是你我守着的那套系统。

本文由安全客原创发布

转载,请参考转载声明,注明出处: https://www.anquanke.com/post/id/316042

安全KER - 有思想的安全新媒体

分享到:微信
+10赞
收藏
安全客
分享到:微信

发表评论

Copyright © 北京奇虎科技有限公司 三六零数字安全科技集团有限公司 安全KER All Rights Reserved 京ICP备08010314号-66