AISI 自 2023 年起一直在跟踪前沿 AI 模型的网络安全能力。在我们的评测中,能力最强的模型始终是闭源权重模型——其参数是私有的,只能通过开发者控制的接口访问。领先的开源权重模型——其参数任何人都可以下载、运行和修改——则始终落后于前者。它们究竟落后多少、差距是否正在缩小,以及缩小得有多快,都是研究人员、政策制定者和网络安全防御者持续关注的现实问题。
开源权重模型带来了实实在在的好处。它们可以私有化部署,不会向模型提供方回传数据,可以针对特定任务进行适配,并且只需承担算力成本即可运行。一旦投入使用,它们就提供了一个可靠的基础,而提供方无法随意更改或停止支持。它们还促进开放协作与创新,以及某些需要访问模型权重的安全研究——包括 AISI 模型透明度团队的部分工作。
但它们也可能带来风险。支撑这些好处的同样的开放性,也让闭源模型开发者能够采取的许多安全措施无法使用,而这些措施可用于发现并阻断滥用、在漏洞出现时迭代防护、控制用户访问以及撤回模型。一旦开源权重模型发布,这些选项就会永久失去:防护措施可以被移除,模型副本可以被下载、再分发,并在无法监控的私有系统上运行。因此,对于具备危险能力的模型——包括网络能力很强的模型——开源权重发布会带来持续且不可逆的滥用风险。
开源与闭源模型之间的网络能力差距之所以重要,其中一个原因在于,它为防御方提供了准备时间:即使当前最强的闭源系统已经可用,网络防御者仍有一个窗口期可以在当今前沿网络能力尚未在缺乏同等防护措施的情况下普及时采取行动。随着前沿 AI 网络能力持续进步,这一点变得更加紧迫;在 2026 年 4 月,两个闭源模型,Mythos Preview 和 GPT-5.5,展示了 AISI 自测试开始以来观察到的 AI 网络能力最大跃升之一,并促使国际社会发出警告,要求立即应对迅速变化的网络风险格局。
这是我们首次公开分析领先开源权重模型与闭源网络前沿之间的差距。我们的评测发现,GLM-5.2(2026 年 6 月)是测试时网络能力最强的开源权重模型。它在 AISI 的短程网络任务上表现与 Opus 4.6(2026 年 2 月)相近,在我们的长程网络演练中则与 Opus 4.5(2025 年 11 月)相近,这意味着它落后前沿 4 到 7 个月。这一差距比我们在 2025 年 1 月至 9 月发布的开源权重模型内部评测中测得的 6 到 10 个月更窄。
下面,我们将详细说明这些结果、我们测试了哪些模型,以及差距缩小对网络防御意味着什么。
我们的评测从较全面的角度考察模型的网络能力。AISI 的短程网络任务评估模型在四个难度等级上的具体网络技能。另一方面,我们的网络演练评估的是自主网络能力——即模型在包含漏洞的模拟网络中,持续完成长时程、多步骤网络攻击的端到端规划与执行能力。
这里我们分享两款开源权重模型的测试结果,之所以选它们,是因为它们在发布时被视为最有可能引领开源权重网络能力发展的模型,分别是 GLM-5.2 和 DeepSeek V4-Pro。我们也引用了 2025 年进行的类似内部测试结果。AISI 计划在 Kimi K3 的权重公开发布后,以同样标准对其进行测试(已宣布将在 7 月底发布)。
AISI 的短程网络任务衡量模型可完成任务的难度,从“技术非专家”——即具备一定技术背景但网络知识有限的新手,例如数据分析师——到“专家”——即通常需要深厚网络安全知识的任务。1 这些任务涵盖多个网络安全能力,例如漏洞研究与利用、逆向工程、Web 利用以及密码学。

图 1:在 AISI 70 项短程网络任务上的平均成功率;每项任务给出 5 次尝试,每次尝试的 token 上限为 250 万。2 虚线连接表现相当的开源与闭源模型,表示其发布时间差距。
在这些任务上,GLM-5.2 的表现与其前 4 个月发布的最强网络模型(Opus 4.6 和 GPT-5.3-Codex)相当,这一点在四个难度等级上均成立。DeepSeek 的 V4-Pro 与提前 5 个月发布的 Opus 4.5 相当。这两个差距都比 AISI 在 2025 年进行的内部评测更窄,当时开源权重模型落后前沿 6 到 10 个月。
尽管 AISI 观察到截至 2026 年 2 月前沿网络能力出现了快速进展,但这一结果并不能预测未来的开源权重模型是否会复现 Mythos Preview 和 GPT-5.5 最近带来的更大跃升。
AISI 的网络演练衡量模型自主实施端到端网络攻击的能力。它们是由专家构建的模拟网络,由主机、服务和漏洞组成,按顺序排列成攻击链,起点是首次获得网络访问权限。与现实世界中防护完善的环境相比,演练目前还缺少活跃防御者、防御工具以及告警惩罚等安全特性。
图 2 展示了模型在网络演练 “The Last Ones”(TLO)中的轨迹:这是一次 32 步的企业网络攻击,横跨 4 个子网,约 20 台主机;我们估计一名人类专家完成它大约需要 20 小时。

图 2:在 “The Last Ones” 中,随总 token 消耗变化而完成步骤数的平均值,单次运行的 token 上限为 1 亿。每条线表示某模型在 10 次运行中的平均轨迹(除非标注为“最佳尝试”);阴影区域显示最小—最大范围。标注为 “M” 的灰色水平线表示攻击链中的重要命名里程碑。
在 TLO 上,GLM-5.2 能达到与 Opus 4.5 相当的进度,后者发布于它之前不到 7 个月, 而 DeepSeek 的 V4-Pro 低于 Sonnet 4.5(这是一款低于网络前沿、但比它早 7 个月发布的模型)。这些结果在我们的其他网络演练中也大体一致。值得注意的是,GLM-5.2 平均以略少的 token 到达了第 7 步,这一成绩优于其他所有模型,并沿着 Opus 4.6 的轨迹推进到第 11 步后才停滞。
这里的差距比我们的短程网络任务更大,但由于与更大规模的短程网络任务套件相比,我们的演练数量较少,因此我们认为来自演练的比较证据相对较弱。此外,仅凭轨迹本身,我们无法判断停滞是因为网络能力不足,无法跨越某个步骤,还是因为代理能力不足,无法持续进行长时程规划与执行。
安全防护措施
总体而言,开源权重部署会让 AI 开发者可用的安全防护措施更少,尤其是在网络这类双重用途领域。监测、分类器和用户封禁等部署期安全措施需要对模型访问具有控制权,而一旦权重公开,这些措施就无法普遍实施。仍然可用的一些技术,例如拒绝训练(训练模型拒绝有害请求),在获得权重后往往很容易被逆转。
我们对近期开源权重模型的评测基本未受到安全防护措施的阻碍。DeepSeek V4-Pro 偶尔会拒绝短程网络任务,主要出现在逆向工程中;我们只需对被拒绝的任务进行少量重复尝试,就能绕过这一点。
成本与性能
按公布的第一方价格计算,我们评测的开源权重模型比更早发布的闭源模型便宜得多。一次 1 亿 token 的网络演练运行,Opus 4.5 和 4.6 的成本大约都是 85 美元,而按当前定价,GLM-5.2 估计为 46 美元,DeepSeek V4-Pro 仅为 1.19 美元。3 在两种模型都能以 100% 可靠性完成的任务上,Opus 4.6 每项任务成本为 15.17 美元,而 GLM-5.2 为 6.12 美元;Opus 4.5 每项任务成本为 12.50 美元,而 DeepSeek V4-Pro 仅为 0.28 美元。
我们测试的局限性
我们的设置很可能会略微低估开源权重模型的最大能力:我们没有进行某些可能提升表现的特定引导或优化。其次,这篇文章只包含网络能力测试;不能据此推断其他能力。
根据我们的评测方法,近期开源权重模型在网络能力上落后前沿闭源模型 4 到 7 个月——这一差距比我们在 2025 年大部分时间内部测得的 6 到 10 个月更窄。这意味着,网络防御者只有很短的准备窗口,去应对当今前沿网络能力可能在缺乏同等防护措施的情况下被广泛获取。国家网络安全中心已经建议各组织投资网络安全基线,并利用 AI 增强防御;我们的发现进一步印证了这一建议。
开源权重模型带来了多种切实好处。挑战在于,随着开源权重前沿在高风险相关领域继续推进,如何在这些好处与安全之间取得平衡。尽管目前没有任何方法能够保证绝对安全,但若能结合使用,若干策略有望显著降低风险。AISI 先前已概述了开源权重模型风险管理中的开放问题,以及涵盖模型训练、防护、审计和访问的可行方法。
目前尚不确定这一差距未来是否会变化。AISI 将继续评测领先的开源权重模型,包括 Kimi K3,以跟踪其能力以及与前沿之间的差距。
1. 我们使用完整 96 项任务套件中的 70 项子集,以便进行历史比较。这 70 项任务包括 18 项技术非专家级任务(通常可由具备技术背景但网络安全经验有限的人解决);25 项学徒级(大约 1-3 年网络安全经验);19 项从业者级(3-10 年经验);8 项专家级(10 年以上)。完整说明见此处。
2. 在使用完整 96 项任务套件、每项任务 5000 万 token 进行评测时,对比模型保持不变。
3. AISI 对测试的开源权重模型未使用第一方提供方,因此实际算力成本可能有所不同。