Fable 5.1 发布几小时就被"扒光":27万字提示词泄露,暴露了AI行业最大的软肋

阅读量6315

发布时间 : 2026-09-02 14:24:18

一个顶级大模型最深的秘密,不是它的权重,而是那套没人打算给你看的”员工手册”。

一、事件:史上最速“开箱即破”

9月2日,Anthropic 正式发布了新一代旗舰模型 Fable 5.1,同步推出的还有面向受审安全专家与生命科学研究者的 Mythos 5.1

这本该是一个属于跑分的日子:

  • ARC-AGI-2:90.0%,每任务 3.12 美元
  • ARC-AGI-1:97.5%,每任务 1.40 美元
  • 平均推理成本比上一代降低约 32%

然而,发布还不到几个小时,剧情就急转直下——知名越狱研究者 Pliny the Liberator 在 GitHub 上甩出一份链接:Fable 5.1 的完整系统提示词,超过 275,000 个字符,全部曝光。

全网沸腾。

讽刺的是,Anthropic 官方当天其实也公布了一份”系统提示词更新”,约 2.7 万字——这已经算是行业里罕见的”透明”举动。但 Pliny 毫不留情地嘲讽:

“你们就这么信了?从我的角度看,官方公布的不过是冰山一角,只有 10% 罢了。”

一个是官方精选的”简历版”,一个是黑客提取的”体检报告版”。两者之间的差距,恰恰是这个事件最值得玩味的地方。

二、27万字里到底藏着什么?

这次泄露的不是几行”你是 Claude,由 Anthropic 创建”的人设宣言,而是一套完整的运行时组装指令,包括核心行为逻辑、记忆系统、搜索与版权规则、Artifacts 和计算机使用指南、插件路由,以及全部 46 个内置工具的 JSON 架构

挑几个最有意思的说。

第一,版权红线细到”离谱”。

Fable 5.1 被严禁重现任何受版权保护的歌曲、诗歌、书籍片段(1929 年之前的公版作品除外)。视觉创作上更夸张:无论用 SVG、CSS 还是 HTML,绝不允许画出任何已知角色、Logo、专辑封面。提示词里甚至白纸黑字点名:“不允许画刺猬索尼克,也不允许画《好饿的毛毛虫》。” 哪怕用户要求改姿势、换颜色、变风格,也不行。

你可以想象,这每一条”莫名其妙”的规则背后,大概率都躺着一封律师函,或是一场真实的诉讼。

第二,记忆系统划出”至死不记”的禁区。

Fable 5.1 的记忆变成后台自动执行,但附带严格的隐私分类边界。以下内容永远不存储:未成年人的身份信息、种姓与移民状态、犯罪记录、心理与精神推断、性史与自残倾向。即使用户主动暴露,系统也会在后台强制清空。

第三,能力膨胀的实锤。

内置工具从 7 月份的 30 个暴增到 46 个:图表展示、轮播图、行程卡片、链接预览……还有一个叫 read_conversation 的工具,可以翻阅你过去的历史对话。Claude 不再是”一刷新就失忆”的聊天框,而是在悄悄变成一个超级工作站

第四,行为约束密不透风。

它不能对用户的心理状态或动机下断言,不能扮演医生,不能放大用户的负面情绪;在毒品话题上采取”减少伤害”策略——可以讲过量的危险和急救方法,但绝不提供剂量、时间安排或配方。

一句话总结:这份 27 万字的”天书”,与其说是提示词,不如说是一份 AI 时代的”员工行为手册 + 合规手册 + 工具说明书”三合一套餐。

三、我的观点:提示词从来不是护城河,但这恰恰是最危险的地方

很多人看到这条新闻的第一反应是:”Anthropic 的护城河被扒了。”

我的看法恰恰相反,而且我认为这件事暴露的问题,比”护城河”要深刻得多。

观点一:提示词从来就不是护城河,权重才是。

先厘清一个技术事实:Fable 5.1 和 Mythos 5.1 本质上是同一个模型,共享同一套权重。区别只在于外面套了多少层护栏——一个是面向公众的”安全版”,一个是面向受审专家的”高权限版”。

这意味着什么?意味着现代大模型的能力核心在权重里,而安全边界在很大程度上是靠提示词和运行时规则”贴上去”的。就算 Pliny 把 27 万字全扒出来,你也复制不出一个 Fable 5.1——你没有它的权重,没有它的训练数据,没有它背后的算力。

所以别再说”提示词泄露 = 底牌尽失”。真正的底牌,黑客碰不到。

观点二:但这恰恰是危险所在——当”安全”主要靠一层文本护栏时,护栏本身就成了攻击面。

权重偷不走,但规则可以被研究、被绕过。

这次泄露的文件里,包含了全部 46 个工具的 JSON 架构、记忆系统的分类边界、插件路由逻辑。对一个攻击者来说,这不是八卦,这是一份侦察地图:知道了防御者在哪里设卡,就知道该从哪里绕行。知道模型”永远不存储”哪些信息,就知道它的记忆机制在哪些时刻会触发清空——机制的透明,往往就是漏洞的开端。

更让人不放心的是 Fable/Mythos 的双版本设计:同一套权重,靠外围规则区分”能给谁看什么”。这本质上是在用一道软件围栏,看管一个能力足以处理网络安全和生物学高风险任务的模型。围栏被完整测绘之后,”把 Fable 问成 Mythos”会不会成为下一个越狱竞赛的目标?这不是杞人忧天,而是越狱社区的日常。

观点三:27万字 vs 2.7万字——”官方透明”与”真实运行”之间的鸿沟,才是行业真正的信任危机。

Anthropic 已经是大模型厂商里相对坦诚的一个了,主动公布 2.7 万字系统提示词,行业里没几家能做到。但黑客用 27.5 万字告诉我们:你看到的,只是十分之一。

这不是要苛责 Anthropic,而是要指出一个结构性矛盾:AI 公司一边要求公众信任”模型是安全的”,一边又把安全机制藏在一个连官方文档都不完整披露的黑箱里。 当公众对 AI 安全的认知,要靠黑客逆向工程来补全时,这个行业的”自我监管”叙事就已经破产了一半。

观点四:对普通用户来说,最该记住的是那几条”至死不记”。

别忘了,这份文件里真正和你我有关的,不是工具数量,不是版权规则,而是那份隐私禁区清单。它之所以存在,是因为真的有人会对 AI 倾诉心理问题、暴露身份信息、讲述难以启齿的经历

看到”未成年人的身份信息””性史与自残倾向”这些条目被白纸黑字写进系统提示词,我的感受不是猎奇,而是心酸——每一条规则背后,都是无数真实用户踩过的坑。而这才是这次泄露里最值得被认真读完的部分。

四、另一面:Fable 5.1 确实强得可怕

公平地说,这次事件的主角之所以值得被”破解”,是因为它真的强。

发布当天,Vals AI 披露:Fable 5.1 用 44 分钟、消耗 17.6 万 token,在没有任何人类干预的情况下,破解了困扰密码学界 370 年的经典密码 Cyphral Distich——1653 年苏格兰学者托马斯·厄克特留下的 64 位数字谜题,位列”全球 50 大未解加密信息”。

关键不在于它破了,而在于它怎么破的:不是暴力穷举,而是横向联想与语境推理。它注意到密码紧跟在 32 篇短文之后、作者反复强调”没有什么数字能比 32 更好”、每篇短文都以”愿望”结尾——然后顿悟:密码本不在别处,就在这本书本身。第 i 个数字对应第 i 篇短文里的第几个词,取首字母,一段祈求查理二世复辟的保皇党诗句跃然纸上。

随后,它顺手又把同一位作者留下的 285 位数字的更大密码也破了。

正如评论者所言:”历史上许多难题之所以未解,是因为缺乏人类的注意力。而现在,这个瓶颈正在消失。”

这才是本次事件最深的隐喻:一个能在 44 分钟内破解 370 年悬案的系统,它自己的 27 万字”内心独白”,在发布后几小时内就被人类破解了。 攻防之间,谁也不比谁更安全。

五、写在最后:猫鼠游戏没有终局

回顾这几年,从 GPT-4 到 Claude Fable 5 的 12 万字,再到今天 Fable 5.1 的 27.5 万字,系统提示词泄露几乎成了每次重大模型发布的”固定节目”。Pliny 们的 CL4R1T4S 仓库,像一个民间档案馆,持续记录着这个行业最不愿意公开的那部分。

这场猫鼠游戏的终局会是什么?我的判断是:

提示词会越来越长,因为每一条规则都是一次事故的补丁;泄露会越来越快,因为攻防的技术在同步进化;而真正决定安全的,终将回到权重层面——回到对齐研究本身,而不是外围的文字护栏。

对厂商而言,与其把系统提示词当作商业机密严防死守,不如想清楚:哪些是必须藏的能力边界,哪些是本该公开的安全承诺。毕竟在黑客面前,隐瞒从来不是安全策略。

对我们普通用户而言,这件事最大的价值,可能是第一次有机会完整地看到:你每天对话的那个”AI”,究竟被多少条规则约束着,又替你挡住了多少东西。

理解这一点,比围观一场”破解狂欢”重要得多。

 

更多AI知识,请扫码关注Aiker World社区公众号

本文由安全客原创发布

转载,请参考转载声明,注明出处: https://www.anquanke.com/post/id/316063

安全KER - 有思想的安全新媒体

分享到:微信
+10赞
收藏
安全客
分享到:微信

发表评论

Copyright © 北京奇虎科技有限公司 三六零数字安全科技集团有限公司 安全KER All Rights Reserved 京ICP备08010314号-66