AI安全进入新阶段:Claude Fable 5的防护逻辑

近日,AI公司Anthropic向公众详细说明了其最新模型Claude Fable 5所采用的一系列网络安全防护措施。这不仅仅是技术细节的公布,更标志着行业在AI安全治理上迈出了系统性的一步。

分级管控:明确AI的安全使用边界

为了有效管理风险,Anthropic将模型可能涉及的网络安全使用场景划分为四个明确的类别:

  • 禁止用途:包括开发勒索软件、制造恶意软件,以及任何旨在破坏网络或物理基础设施的活动。这类请求会被模型直接拒绝。
  • 高风险限制用途:对于像渗透测试这样具有“双重用途”性质的活动(既可用于安全防御,也可用于攻击),在建立更完善的控制机制前,模型会采取拦截策略。
  • 中低风险用途无害用途:针对教育、研究等良性目的,模型会在安全护栏内提供相应的支持。

这种分类管理的方式,使得AI的行为有了更清晰的“交通规则”。

量化风险:全新的“网络越狱”严重性评级体系

更引人注目的是,Anthropic提出了一套名为“网络越狱严重程度”(Cyber Jailbreak Severity, CJS)的评估框架。该体系旨在客观衡量诱导AI突破其安全限制(即“越狱”)的行为所造成的潜在危害。

  • 五级评级:从CJS-0(无风险)到CJS-4(严重风险),共五个等级。
  • 四维评估:每个等级的判定基于四个关键维度,包括潜在危害的范围、实施的难易度、规避检测的可能性以及攻击的持久性。

这套框架为安全研究人员和开发者提供了一个共同的语言和标准,来讨论和比较不同“越狱”手法的危险性。

开放协作:邀请全球白帽黑客参与测试

为了主动发现并修复潜在漏洞,Anthropic同步启动了HackerOne漏洞赏金项目。该项目正式邀请全球的安全研究人员和道德黑客,提交他们发现的、可能使Claude Fable 5模型绕过安全限制的案例。这种“以攻代守”的开放态度,有助于在真实世界攻击发生前加固模型防线。

从清晰的使用场景分类,到量化的风险评级框架,再到开放的社区测试,Anthropic为Claude Fable 5构建了一套立体的安全防护策略。这反映出AI行业正从单纯追求能力提升,转向能力与安全可控性并重的新发展阶段。