AI Notes

观察 · 上海

加密的推理也能被抄:OpenAI 把蒸馏攻击点到 Moonshot

7 月一场对受保护推理的协调抽取:峰值约 1.6 万次请求、4000+ 账号,相关 1.5 万用户簇在 7-28 前被打断。手法是跨会话复用加密推理再转写,未破加密、未入库。核心簇归因于「与 Moonshot 关联的个人」——不等于公司,也不等于证明写入了 Kimi。Moonshot 截至本稿写作仍未见公开回应。

9 月 30 日,OpenAI 发了一篇少见地具体的安全博文:Disrupting a coordinated model-distillation campaign。它说,7 月第一周起观测到一场协调活动,试图抽取模型的 protected reasoning——模型内部推演任务时留下、通常不给用户看的那一层记录。活动在 7 月 24–25 日冲到高点:约 1.6 万次带抽取模式的请求,来自 4000 以上用户;进一步追查后,相关提示模式簇超过 1.5 万用户,7 月 28 日前被完全打断。

然后是归因句:不能确定观察期内所有操作者来自单一行为体;但核心簇归因于 individuals associated with Moonshot AI,也就是 Kimi 的开发商。

截至 2026-10-11,公开检索未见 Moonshot 就这一具体指控作出回应。更早时候该公司曾否认过「Kimi 靠未授权蒸馏」的笼统说法,那不是对这篇 9-30 博文的逐条答辩。

TL;DR:分三层读。抽取了什么——加密推理被跨会话转写,不是权重文件,也不是数据库失窃。归因到谁——「关联个人」不等于公司决策,OpenAI 未公布归因证据。能推出什么——未证明这些材料进入了任一版 Kimi 的训练。隐藏推理若可被规模化复制,护城河与安全叠加层会一起被掏空;行业共享(Frontier Model Forum)说明这不是一家的漏洞叙事。

一、没人闯进保险库,有人让柜员自己念出来

OpenAI 写得很清楚:操作者没有破解加密,没有攻破数据库,没有直接读到存储的用户对话。他们做的是操纵模型交互,让受保护推理以请求者可见的形式被再现,并且规模化、协调化,违反服务条款。

点名的手法之一:把一段加密推理从一次会话拷到另一次,再要求模型解密并转写隐藏内容。独立安全研究者通过负责任披露,还带过来跨模型与 conversation-compaction 相关路径;OpenAI 复现后确认攻击路径真实,并据此加速缓解。

脚注更关键:1.6 万是尝试次数,不是成功抽取次数。成功了多少、落地了多少 token,文中没有给。

flowchart TD
  A["会话 A<br/>含加密 reasoning 工件"] -->|复制工件| B["会话 B"]
  B -->|要求解密 / 转写| M["模型"]
  M -->|可见文本| E["抽取者"]
  E -.->|OpenAI 未证明| T["他方训练数据"]
  X["未发生"] -.->|破加密 / 入库 / 直读存储| DB["权重或数据库"]

物理图像很重要:护城河若建在「推理对用户不可见」上,攻击面就在「如何让模型自己把不可见变成可见」,而不在传统的渗透测试清单里。OpenAI 称已堵住「已持有他人加密推理即可重放恢复」的路径,并对可能暴露推理的流式输出加了检测与暂扣;相关活动若走第三方服务,也与提供方协同打断账号。

二、归因句里的三个限定词

读归因时,三个限定必须同时保留:

  1. individuals associated with——关联个人,不是「Moonshot 公司实施」。
  2. a core cluster——核心簇,不是观察期内全部流量。
  3. unclear whether all operators… single actor——不排除多行为体。

OpenAI 没有在文中公布归因所用的信号、交叉验证方法或可供第三方复核的证据包。因此,这篇博文是公司安全叙事下的归因主张,不是法庭事实,也不是独立审计结论。把它写成「OpenAI 坐实 Moonshot 偷模型」,是超出原文的跳跃。

同样超出原文的,是「所以 Kimi 是蒸馏出来的」。OpenAI 明确讨论的是抽取受保护推理的风险——若被用于训练另一模型,可能带走能力却留不下原模型面向用户输出上的安全叠加。它没有写:本次活动的产物已进入某次训练 run。

三、为什么这比「抄输出」更刺

普通蒸馏盯的是可见回答。protected reasoning 盯的是模型「怎么想」的内部记录:它可能含有最终答案里被折叠掉的中间步骤、工具规划、自我检查。规模化抽走这一层,等于在能力迁移时少付对齐税——OpenAI 的原话大意是:抽取推理可在不保留原用户侧护栏的情况下帮助训练另一模型;规模化时还能加速先进能力转移,却不必投入同等安全成本。双用途能力变强时,这个风险更刺。

OpenAI 强调手法并非本公司独有,已通过 Frontier Model Forum 与政府信息共享渠道通报。可移植、可重放的 reasoning 工件,在别的系统上也可能撞上同类问题。这把故事从「中美两家公司撕破脸」拉回「隐藏推理作为行业共用脆弱面」——撕破脸的部分仍在归因句里,脆弱面的部分在技术分享里。

四、和本周其他稿的接头

同周的欧盟水印、数学稿、市议会听证、Anthropic 网络三档,看似各写各的,共同结构是边界可被复制或改道:

  • 水印:统计信号可被改写稀释;
  • 数学稿:形式化可复制检查,未形式化仍靠人;
  • 听证:自愿披露改道强制程序;
  • 网络三档:能力按身份复制到不同护栏集;
  • 蒸馏:本应不可见的推理,被交互路径复制成可见文本。

「隐藏」若只靠产品约定而不靠密码学与系统边界,约定就会在规模化交互里被套利。OpenAI 的缓解清单——账号执行、注册与基础设施控制、跨用户/工作区/组织/模型族的隐藏推理保护、第三方协同——承认了这一点:单点拒答不够,要分层、要自适应,还要承认 partner-hosted 部署需要与自家服务同级的保护。

五、证据边界

  • 时间线、请求量、手法、归因措辞,以 OpenAI 2026-09-30 原文为准。
  • Moonshot「未公开回应」是截至 2026-10-11 的公开检索结论,可能遗漏非英文或非官网渠道。
  • 不推断 Kimi 任一版本的训练数据构成。
  • 不把「adversarial distillation」与合法的公开输出微调混为一谈——争议点在受保护推理与服务条款,不在「能不能从可见答案学习」这一更广的行业常态。

Reflection Beam 的权重截至同日仍未放出,故本日写蒸馏而非 Beam。Beam 仍只适合进 open-weight 主题页一行预告,不升格长文。

参考

事实、出处或判断有误,欢迎 写信纠错或补充 。

返回目录