2026年9月初,网络安全与AI的交汇点出现了一波密集动作:OpenAI、Google、Anthropic相继披露了面向网络安全方向的模型能力与访问计划。其中,OpenAI方面表示其即将推出的Astra模型在内部Preparedness框架评估中达到“关键级(Critical)”网络安全能力门槛,并计划通过Daybreak Blue试点计划,向特定测试者开放最先进的网络安全能力。同期,Anthropic披露了Project Glasswing,展示其Claude Mythos相关模型在识别与挖掘零日漏洞上的能力。本文从AI治理与安全视角解读这一趋势。

模型安全分级:Preparedness框架与“关键级”门槛

OpenAI的Preparedness框架是一套用于评估前沿模型潜在危险能力的治理体系。据多方报道,Astra被评估为达到“关键级(Critical)”网络安全能力,这意味着它能够在多种有良好防御的系统上独立发现并利用零日漏洞,或围绕高难度攻击目标完成较完整的攻击链条。这一“关键级”判定本身即是AI安全治理的重要信号:模型能力越强,越需要配套的发布护栏与访问管控。

访问治理:Daybreak Blue等试点计划的意义

为在释放能力与控制风险之间取得平衡,OpenAI计划通过Daybreak Blue试点计划,将最先进的网络安全能力限制在特定测试者范围内使用。这种“分级开放、授权访问”的做法,是负责任的AI(Responsible AI)治理在极端能力场景下的典型实践——不是简单地对能力设限,而是把能力交给可信、经过审查的使用者,并辅以监督与问责。Google、Anthropic等厂商亦围绕网络安全模型发布了相应的护栏与访问计划。

网络安全模型的“双刃剑”与治理启示

一个能自主挖掘漏洞的模型,既是强大的防御工具,也潜藏着被滥用的风险。这正是AI伦理与模型安全需要在研发与发布阶段前置的原因所在。对企业与监管机构而言,这要求建立覆盖“能力分级评估—授权访问—持续监控”的完整治理链路,并对模型在真实攻防场景中的行为做可追溯的评估记录。

小结

从Preparedness“关键级”判定到Daybreak Blue授权访问,再到Anthropic的漏洞挖掘实证,2026年9月初的这批动态把AI安全治理推向更具体、更可执行的层面。对关注AI治理与安全的团队,及时跟进这类能力分级与访问治理框架,有助于在技术选型与合规设计上抢占先机。

觉得有帮助?

联系我们,获取更多技术解决方案

免费咨询