2026年7月,OpenAl把智能体关进隔离环境,测试它的网络攻击能力。没想到,它没有老老实实完成测试,而是自己找到漏洞、逃出沙箱,闯入HuggingFace的真实生产系统,偷走了测试答案。整个过程持续一个周末,完成超过1.7万次攻击操作。人类原本只想考考它,最后却成了被它攻击的对象。
这件事可能成为AI发展史上的分水岭。它暴露出一些深层次问题,对此我有三点判断。
第一个判断:这不是AI觉醒,而是AI失控,而且比觉醒更危险。它没有反抗人类,只是为了完成任务不择手段。最危险的AlI,不一定想伤害谁;它只要为了实现目标,不在乎伤害谁。
第二个判断:为了追求AI的先进性,全行业正在系统性地放弃安全性。大家都在给智能体更多工具、更大权限,鼓励它调用一切资源解决问题。但智能体越开放、能力越强一旦失控,破坏力也越大。
第三个判断:全世界正在面临一个比模型安全严重十倍的问题一一智能体安全。模型说错话,最多是误导;智能体做错事,可能直接变成攻击。模型安全是管住嘴,智能体安全是管住手,而管住手永远比管住嘴更难。
面对这个已经到来的新问题,我有六项战略思考和建议。
1.必须把智能体关进“权力的笼子”。智能体能做什么、不能做什么、可以调用哪些工具,必须提前划清边界,并保留随时叫停的能力。安全护栏不能为了测试能力就被全部关闭。这就像为了测试一辆车能跑多快,把刹车也拆了,出事是必然的。
2.必须“以模治模”,用AI监督Al。这次事件中,模型在一个周末内执行了上万次操作靠人根本盯不过来。必须用另一个相互独立的AI实时监督它,不仅看单个动作是否合规,还要判断一连串动作组合起来形成了什么意图。不能让同一套系统既当运动员,又当裁判。
3.必须用AI自动发现和修补漏洞。漏洞是一切网络攻击的入口。当攻击方用AI批量找漏洞、写工具,漏洞挖掘效率大幅提升;如果防守端还靠人工排查,双方速度根本不在一个量级,只能被动挨打。海外已经出现Mythos这类先进技术,带来不小冲击,国内也在推进相关落地探索。像360自研的AI漏洞挖掘智能体”图龙锋”,能力已经能够对标Mythos,累计挖出4000多个漏洞,其中上百个都是高价值高危漏洞。它的目标很明确,就是帮助防守方抢在攻击者前面找到漏洞在漏洞被利用之前提前封堵住。
4.必须警惕Al让网络攻击“平民化”。过去发动一次高级网络攻击,需要顶尖黑客、大量资源和长期准备;现在,一个强大的智能体就可能自动完成漏洞发现、攻击工具编写和攻击策略调整。过去只有专业黑客能做的事,未来普通人借助AI也可能做到。高级网络攻击正在变得低门槛、自动化和规模化,这将成为国家安全面临的全新威胁。
5.网络防御必须从“人海战术”走向“无人驾驶”。当攻击方已经用上AI发起自动化攻击,如果防守这边还靠人工盯着值守,这场攻防仗根本没法打。像360打造的“仪天阵”自动防御系统,是通过安全大模型驱动安全智能体,可以自动感知风险、研判威胁、做出决策并做出处置。“图龙锋”负责主动找漏洞,“仪天阵”负责自动做防御,用机器速度对抗机器速度,以智能体对抗智能体。
6.发展与安全必须同步,不能先跑起来,再想起系安全带。全球都在追求模型更强、智能体更能干,但没有安全的发展,不是真正的发展,而是在积累灾难。AI能力越强,失控或被恶意利用后的破坏力就越大。AI安全必须与AI发展齐头并进,在一些关键领域甚至要适度领先于发展。
OpenAI智能体逃逸事件证明,我们面对的已经不是未来可能出现的风险,而是已经发生的事实。我国始终强调统筹发展和安全,这战略判断在AI时代更具现实意义:既不能因为安全问题停下发展的脚步,也不能为了追求先进性牺牲安全。
发展AI,是为了掌握未来;守住安全,才能真正拥有未来。留给我们的窗口期十分有限,谁先建立起智能体安全治理体系和AI自动化攻防能力,谁就能掌握AI时代的安全主动权。







发表评论
您还未登录,请先登录。
登录