AI Notes

观察 · 上海

Anthropic 把网络能力拆成三档:防守、红队、关键基础设施

Cyber Verification Program 与 Project Glasswing 合并为 Defense / Red Team / Specialized。CyScenarioBench 自测:无 CVP 时 50/50 首提示即挡;Defense 档 46/50 被挡;Red Team 档零拦截、完成 34/50。分类器阈值本身就是发布政策;数据留存是入场券。

10 月 6 日,Anthropic 宣布扩展 Cyber Verification Program(CVP):与 Project Glasswing 合并,改成三档——Defense Access、Red Team Access、Specialized Access——覆盖 Claude Opus 5.5、Sonnet 5.5、Mythos 5.1 及后续新模型。一般可用模型仍带着保守的网络护栏,挡住大部分网络工作;要做认真的防守或授权攻防,得先证明身份,再换一档分类器。

这不是又一次「我们很重视安全」的博客。这是把门口做成表格。

TL;DR:前沿网络能力的默认发布形态,正在变成「按身份分级」。Defense 挡大多数多阶段进攻;Red Team 在自测里零拦截,完成率与无防护相当;Specialized 与美国政府逐家审,护栏最少。入档须数据留存以监测滥用(EFS 秋季前,部分 ZDR 客户例外)。接 Astra Critical、Sonnet 5.5、Argon Fairwind 同一条线:先改谁能用,再谈模型有多强。Glasswing 伙伴自报的 12.9 万漏洞是下限、来自部分伙伴问卷,不进标题当确定战果。

一、三档分别打开什么

官方描述可以收成一张表:

档位覆盖的工作谁能申请仍挡住什么
DefenseSOC / 应急响应、恶意软件逆向、分析与验证漏洞企业/高校/政府安全团队、各类关键基础设施运营方、开源维护者、有报告漏洞履历的个人(需付费档)多阶段进攻类工作大量被挡
Red Team上述 + 授权渗透与红队仅组织:内部红队、政府红队、渗透测试公司勒索软件部署、损坏物理系统、对高风险安全系统做渗透等实时拦截仍在
Specialized对「影响人命或扰乱市场」的安全系统做测试:航电、电网、电信、跨行清算、政府行政网等有限名单;与美国政府深度联审;Glasswing 成员迁入本档、当前模型免再批「最少的网络拦截」

Defense 目标是数日内回复;Red Team 可能数周,审核期间先给 Defense。Specialized 不经第三方云平台的完整路径开放——Help Center 写明该档不通过第三方平台提供。CVP 可走 Claude Platform、Vertex AI、Microsoft Foundry;Bedrock 仅对符合 Enterprise Frontier Safeguards 的客户开放。

一般可用模型仍可做:代码审查、修已知问题、在自有源码里找漏洞、分诊安全告警。换句话说,默认货架不是「不能碰安全」,而是「不能碰会滑向进攻链的那一段」。

二、自测把阈值写成了数字

Anthropic 用 CyScenarioBench——测模型能否在现实约束下规划并执行多阶段网络操作——跑 Opus 5.5,按各档护栏设置:

  • 无 CVP:10 题 × 5 次 = 50 次试验,全部在首个提示就被挡;
  • Defense:50 次里 46 次在挑战中某处被挡,4 次走完;
  • Red Team:零拦截,完成 34/50,与「无防护」时约 67.6% 的完成率相当(官方称 Specialized 代表性表现与此同类)。
flowchart LR
  GA["一般可用<br/>保守网络护栏"] -->|申请+核验| D["Defense<br/>46/50 仍被挡"]
  D -->|组织+数周审| R["Red Team<br/>0 拦截 · 34/50 完成"]
  R -->|美政府联审| S["Specialized<br/>最少拦截"]
  GA -.->|CyScenarioBench| Block["首提示即挡 50/50"]

读这张表时有两件必须同时成立的事:Defense 对「防误用」是真挡;Red Team 对「给授权攻防松绑」也是真松——松到与无防护同级完成率。政策不在模型卡的形容词里,在分类器阈值里。

三、数据留存换访问

入档组织须接受数据留存,以便监测网络滥用。Anthropic 称秋季将推出 Enterprise Frontier Safeguards(EFS):把零数据留存的隐私与稳健护栏合在一起,合格组织可把数据放在自己控制的云上。在此之前,已有 Fable 5.1 / Mythos 5.1 零数据留存权限的客户,也可以在 CVP 下继续零留存。

这是一笔写得很清楚的交易:要更强的网络能力,就留下可审计的使用痕迹;想零留存,等 EFS,或先坐在已有 ZDR 例外里。Bedrock 路径直接把 EFS 资格绑进可用性。隐私与防守能力不再是两份独立产品说明书,而是同一张申请表上的勾选项。

四、和 Astra、Fairwind、Sonnet 放在一起读

OpenAI 给 Astra 标网络安全 Critical,高阶攻击默认拒答;Google 的 Gemini 4 Argon 先走 Fairwind,只给受信任防守方;Anthropic 先前让 Sonnet 5.5 带上接近旗舰的网络防护,又把 Mythos 关在 Glasswing。CVP 三档是这条线的显式化:同一套权重,按身份换护栏,而不是按「中档/旗舰」换防护强度。

Glasswing 伙伴 4–7 月自报至少 12.9 万个已验证漏洞,Anthropic 自有开源扫描另计约 5500;其中逾 3.3 万评为 critical/high。官方写明:基于 33 份伙伴问卷子集、分诊口径不一、不到一半披露了已修复数——是下限,真实影响「预期至少高五倍」仍是公司外推。本稿把这些数字留在正文作量级参考,不写进标题,也不当成独立审计结论。

五、证据边界

  • 档位定义、评测数字、漏洞统计均来自 Anthropic 2026-10-06 原文与 Help Center;CyScenarioBench 为公司自测。
  • 「Red Team 等于摘掉防护」在完成率意义上成立,但原文仍保留对勒索软件、物理损害、高风险安全系统渗透的实时拦截——不是绝对零护栏。
  • Specialized 与美国政府的联审细节、国际扩容进度,公开材料未展开。

门口政策一旦表格化,争论就会从「模型该不该这么强」换成「谁有资格坐哪一档」。这是进步——可争议的对象变清楚了——也是新的风险:档位审核本身成为能力分配权,误审、拖延与地缘标准都会变成网络能力供给的一部分。

参考

事实、出处或判断有误,欢迎 写信纠错或补充 。

返回目录