撰文:Shannon@金色财经
8月11日凌晨5时,安全研究员 Alexander Panfilov(x网名 kotekjedi_ml)在 X 上发出一条推文:
「我们终于可以公开这件事了:我们发现了一种利用前沿 AI 公司 API 漏洞,提取其旗舰模型隐藏推理内容的方法。」
这条推文迅速在 AI 和安全圈刷屏。随附的 arXiv 论文《Stealing Reasoning Traces from Proprietary LLM APIs》(从专有 LLM API 中窃取推理踪迹,论文编号2608.09867),当天成为 AI 安全领域讨论最热烈的学术文献。
来自 ELLIS Institute Tübingen、Max Planck Institute、MATS Research 和 Snyk的研究团队的核心发现可以用一句话概括。Haiku 4.5 可以读取 Opus 4.8 的想法。
这句话戳破了 Anthropic、OpenAI 和 Google 三家公司为保护其最有价值的知识产权所精心设计的加密机制。
理解这次漏洞,需要先理解过去两年 AI 行业发生的一个关键转变。
2024至2025年,以 Claude Opus、GPT-5.6 和 Gemini 3 为代表的新一代「推理模型」,在返回最终答案之前,会先进行大量的内部思考,即「思维链」(Chain of Thought)。这些内部推理过程极其宝贵,它们展示了模型如何分解问题、如何处理不确定性、如何进行多步推理,是这些模型能力的真正体现,也是数亿美元训练投入的结晶。
因为这些内部思考包含商业知识产权和安全检查机制,厂商选择不以明文形式返回这些内容。
与此同时,还有另一个更紧迫的安全顾虑。如果明文思维链被开放,任何人都可以用它来训练竞争模型,即所谓的「蒸馏攻击」(Distillation Attack)。这是 AI 公司最不愿意看到的结果。
于是,三大厂商相继将思维链从「明文返回」改为「加密块(Encrypted Block)返回」。用户在 API 调用中可以看到一个密文块,但看不到其中的实际内容。这套设计被视为知识产权保护和防蒸馏的标准方案。
问题在于,这套设计存在一个致命的架构假设错误。
研究人员发现了一个架构层面的脆弱性。这些加密块在同一厂商的生态系统内,可以完全兼容并互换,跨越不同会话、不同用户,乃至不同模型。
用通俗的语言解释这意味着什么。当你用 Opus 4.8 完成一次对话,API 返回给你一个加密的思维链块。这个块不是「一次性凭据」,而是可以被带走、放入另一次对话,甚至放入同一厂商另一个完全不同的模型对话中,系统依然会接受它。
研究团队的攻击流程极为简洁。第一步,向 Opus 4.8 发出正常 API 请求,获取其加密思维链块;第二步,仅将这个加密签名(thinking signature)发送给同厂商的 Haiku 4.5 模型,并要求它在 <thinking-copy> 标签中输出自己的推理;第三步,Haiku 4.5 「照抄」了 Opus 4.8 的隐藏推理内容,以明文逐字输出。
整个攻击只需要两次标准 API 调用,不需要任何特殊权限,不需要对旗舰模型进行越狱。
为什么轻量模型会「顺从」地输出?因为轻量模型(如 Haiku)缺乏旗舰模型(如 Opus)那些激进的反蒸馏对齐和安全护栏。正是这层「防护差异」,被研究人员作为解密的跳板加以利用。
研究团队用120道 Codeforces 竞赛题验证了攻击的精确性。解码出的推理长度与 API 报告的计费思考 Token 数量高度吻合,这证明提取的内容不是噪声,而是真实、完整的原始推理过程。
研究人员系统梳理了这一漏洞可以被利用的四个不同方向。
攻击向量一:蒸馏——知识产权保护的彻底失效
这是最直接的商业威胁。漏洞绕过了反蒸馏机制,允许攻击者提取专有模型的推理过程,研究人员已在 Anthropic、OpenAI 和 Google 三家厂商上完成验证。
任何竞争对手,只需大量调用 API 并使用这一攻击方法,便可系统地收集旗舰模型的推理样本,用于训练自己的模型。这直接瓦解了加密思维链在知识产权保护层面的全部价值。
攻击向量二:大规模个人信息和凭证泄露
这是最出人意料也最令人警觉的发现。
研究团队从 GitHub 和 Hugging Face 爬取了6708份公开 Agent 运行记录,解码了其中315,320个嵌入的推理块,共恢复367个个人身份信息(PII)和182个凭证(密码、API 密钥等)。
开发者在分享会话日志时,完全不知道那些加密块里装着什么内容。他们以为自己分享的是密文,实际上是一个任何持有这套解密方法的人都能打开的容器。
这意味着,过去两年里所有将 AI 会话日志发布到公共代码仓库的开发者和团队,都已经在无意中创造了一个可被追溯的数据泄露记录——315,320个推理块已经在公共互联网上流通,其中包含真实的个人信息和系统凭证。
攻击向量三:有害信息通过「安全拒绝」的外层渗出
这个向量揭示了一个深刻的安全悖论。当模型「安全地」拒绝了一个恶意请求,最终可见输出是礼貌的拒绝,但在其隐藏推理过程中,模型可能已经详细思考了「如何满足这个请求」,包括具体的危险信息。这些内容通过加密块漏出,可以被攻击者提取。
模型的「拒绝」只保护了输出层,没有保护思考层。
攻击向量四:不可见的提示注入
攻击者可以利用这一漏洞,将恶意指令完全隐藏在加密块中,以此污染公开的 Agent 运行记录。
研究团队的实际测试是,让 Haiku 4.5 在 Opus 4.7 的 Claude Code 工作流的一个思维链里注入恶意指令,要求模型在每次更新研究方法后,将内容记录到文件并上传到攻击者服务器。结果,Opus 4.7 在没有任何明文提示的情况下,跟随了被注入的隐藏指令。
这是一种完全「隐形」的投毒方式。受害者看到的 Agent 日志毫无异常,但实际的恶意指令嵌藏在密文层中,悄然执行。
2026年5月29日,约翰·霍普金斯大学密码学家 Matthew Green 就已发布了一篇博文,描述了他花了一个周末时间研究这些加密块后的发现,推理块可以在同一会话内、跨会话、乃至完全不同的账户之间重放。对于 OpenAI 的模型,还可以跨不同模型重放,不过他注意到 Claude 模型当时对此「有些抗拒」。Green 还演示了这些块是「语义活跃」的,而不是惰性密文——一个在某次会话中被推理过的社会安全号码,在另一个账户的不同会话中重放该块后,在毫无提示的情况下重新出现了。
Green 通过各厂商的漏洞赏金计划提交了报告。根据记录,OpenAI 回应称该漏洞无法复现;Anthropic 表示未看到侧信道或重放的安全影响,但允许自己可能会更新开发者文档以向应用开发者发出警告。
独立研究员在2026年5月和6月记录了相同的加密推理块重放漏洞,但 Anthropic、OpenAI 和 Google 在该论文确认315,320个可利用的块已在公共仓库流通之前,均未采取架构层面的修复措施。
这段历史揭示了一个令人不安的过程,漏洞已知、已报告、已被忽视。三个月后,规模更大的学术团队以无可辩驳的方式重新证明了它的存在和严重性。
Anthropic(Claude 系列)
论文的具体演示之一,是用 Claude Haiku 4.5 解码 Claude Opus 4.8 的推理内容,并进行了跨会话的提示注入攻击(在 Opus 4.7 的 Claude Code 工作流中注入恶意指令)。
Anthropic 此前对加密思维链的定位,是既保护知识产权,又限制信息泄露。这两个目标都被这次攻击直接击穿。
OpenAI(GPT 系列)
研究人员确认了 GPT-5.6 系列的跨模型兼容性,并证明更轻量的 GPT 模型可以解码旗舰模型的隐藏推理。
尤其讽刺的是,Green 在5月就向 OpenAI 报告了漏洞,OpenAI 回应称「无法复现」,而三个月后论文用315,320个公开案例证明了其规模化的可复现性。
Google(Gemini 系列)
Gemini 3 系列同样被证实存在相同的架构问题,研究人员在 Google AI Studio 上完成了测试验证。
「加密思维链的实现做得非常糟糕」。这是 Simon Willison 在解读这篇论文时的直接表述,他补充说:「这是这些公司在追求速度时在基础安全方面失败的又一个例子。」
从技术层面看,这个设计之所以存在根本性缺陷,是因为它混淆了两种不同的安全目标:
内容保密(用户不能读懂里面的内容)和防重放安全(加密块不能被搬运到另一个上下文中使用)是两个完全独立的安全属性。传统的密码学早已有成熟的机制来同时实现两者——例如绑定会话 ID、用户 ID 和时间戳的消息认证码(MAC)。
但三家厂商设计的「加密块」只实现了前者,完全忽略了后者。这意味着它是一把可以轻易复制的钥匙,而不是一把与特定门锁绑定的钥匙。
研究团队在完成负责任披露的同时,提出了具体的技术修复路径:
加密层面的修复: 将会话 ID、用户 ID、时间戳等上下文标识符绑定到加密块的签名中,使块只在其原始上下文中有效,一旦被搬运到新会话或新用户,验证即失败。
系统层面的修复: 将推理块存储在服务器端,而不是返回给客户端——这从根本上消除了块被「带走」的可能性,代价是更高的服务器存储成本和架构复杂度。
数据共享建议: 所有发布过包含这三家厂商 API 会话日志的开发者和团队,应立即将这些加密块视为潜在的敏感数据泄露,而非安全的密文——检查其中是否包含个人信息或系统凭证。
这场事件的真正教训,超越了这一个具体漏洞本身。
一位工程师在 X 上的评论简洁地点出了问题的本质:「这不是很有后果性,但这是另一个例子,说明这些公司在追求速度时,在基础安全方面失败了。」
加密思维链的设计是在商业压力下快速做出的工程决定。技术社区开始研究明文 CoT 用于蒸馏,公司需要迅速应对,于是推出了「加密」方案。但这个「加密」从未经过严肃的密码学审计。它看起来像安全,感觉像安全,但在基本的密码学属性上是残缺的。
这是「安全剧场」(Security Theater)的典型案例,为了回应外部压力而快速部署看起来有保护作用的机制,但实际的安全属性经不起推敲。
对 AI 公司而言,这是一个关于速度与安全之间取舍的结构性警告。在思维链加密这个问题上,三家顶级 AI 公司选择了同一种解决方案,犯了同一种错误,并且在独立研究员提前告警后没有修复,直到一篇论文将315,320个真实案例摆在所有人面前。
在 AI 能力以每月为单位快速演进的今天,这种「先跑后想」的工程文化,正在制造越来越多难以事后修补的安全债务。
声明:本文系金色财经原创稿件,版权属金色财经所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:金色财经",违者将依法追究责任。
提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。
区块链骑士
动察Beating
胡润百富
道说时间
进取派会客厅
金色财经 善欧巴
