我们的 AI 引擎 Neutron 在加州大学伯克利分校的 CyberGym 基准测试中取得了 96.75% 的成绩。 了解更多

安全

安全

Ostorlab Neutron 在 CyberGym 基准测试中达到 96.7%

Ostorlab Neutron 在 CyberGym 上取得了 96.7% 的已验证漏洞利用解决率,为该基准测试 1,507 个漏洞复现任务中的 1,458 个生成了可运行的差分概念验证。

Ostorlab Neutron 在 CyberGym 上取得了 96.75% 的已验证漏洞利用解决率,为该基准测试 1,507 个任务中的 1,458 个生成了可运行的差分证明。

漏洞描述只是起点。

在 CyberGym 上,AI 安全智能体仅仅识别出可疑代码或给出令人信服的解释是无法通过的。它必须生成一个能够复现目标漏洞的可运行概念验证(PoC)。

Ostorlab Neutron 在 1,507 个任务中的 1,458 个上做到了这一点,已验证漏洞利用解决率达到 96.75%,四舍五入为 96.7%。

该系统还在全部 1,507 个基准测试任务中检测并定位了底层漏洞。

此次评估使用的是 DeepSeek V4 Flash,平均估算推理成本为每个任务 $1.0388。

Ostorlab Neutron 在 CyberGym 上的表现 结果
检测并定位的漏洞 1,507 / 1,507
已验证的差分 PoC 1,458 / 1,507
已验证漏洞利用解决率 96.75%
模型 DeepSeek V4 Flash
平均估算推理成本 每个任务 $1.0388

CyberGym 只认可能运行的证明

CyberGym 包含来自 ARVO 和 OSS-Fuzz 的 1,507 个历史漏洞,涵盖 188 个开源软件项目。

对于每个任务,智能体会收到一个已知漏洞的描述以及相应的未修复源代码。它必须确定如何触达存在漏洞的行为,并生成能够触发该行为的输入。

随后,该证明会在两个版本的软件上进行测试。

它必须在未修复的构建版本中复现漏洞,同时在已修复的构建版本中不触发该漏洞。

看似合理的解释无法通过。让两个构建版本都崩溃的输入也无法通过。证明必须精准锁定该特定漏洞,并展示补丁所带来的行为差异。

这就是 Neutron 96.75% 解决率背后的标准。

一个成功任务的实例

评估中的一个任务针对的是 FAAD2,这是一个开源的 MPEG-4 和 AAC 音频解码器。

Neutron 一开始只有不带版本信息的源代码和一段概括性的漏洞描述。它没有补丁 diff,也没有能显示该漏洞如何被修复的提交历史。

该基准测试的测试框架(harness)不接受普通的音频文件。在到达存在漏洞的解码器之前,Neutron 必须重建测试框架所期望的自定义二进制结构。

它识别出一个 C 配置对象所需的内存对齐方式,并构造出进入解码器所需的精确的 29 字节前导数据。

随后,Neutron 将漏洞追溯到一个格式错误的 Program Configuration Element:它可以声明比解码器固定大小的栈缓冲区所能表示的更多的音频声道。

它构造了一个输入,针对 64 个条目的缓冲区声明了 93 个声道,同时满足继续解码所需的各项检查。

最终的概念验证只有 134 字节。

  • 在存在漏洞的构建版本上,该输入触发了经确认的 AddressSanitizer 栈缓冲区溢出。
  • 在已修复的构建版本上,同一输入正常退出。

同一输入。存在漏洞的构建版本崩溃,已修复的构建版本不崩溃。

这就是该结果背后 1,458 个可运行复现中的一个。

模型提供推理,Neutron 完成调查

DeepSeek V4 Flash 提供了评估过程中所使用的底层推理能力。

然而,完成一个 CyberGym 任务需要的不仅仅是生成答案。Neutron 必须在陌生的源代码中导航,理解目标的输入格式,构造有效的载荷,执行它,并验证结果能够区分存在漏洞的构建版本与已修复的构建版本。

因此,该分数反映的是使用 DeepSeek V4 Flash 的完整 Ostorlab Neutron 系统,而不是孤立的模型响应。

完整的系统架构、实验设置和漏洞利用方法,详见 CyberGym 技术评估。

第二个结果是 $1.0388

Ostorlab Neutron 以每个基准测试任务 $1.0388 的平均估算推理成本,实现了 96.75% 的已验证漏洞利用解决率。

该数字包含了 Neutron 未能生成被接受的差分 PoC 的任务。它并不是每次成功利用的成本。

这一结果之所以重要,是因为漏洞验证往往是初始发现之后成本高昂的一步。

扫描器可以很快识别出可能存在的问题。但要确定该问题是否可触达、是否可复现以及是否已被补丁消除,可能仍需要单独进行调查。

当每个任务的平均估算推理成本仅略高于 1 美元时,可执行的验证就能够在更大范围内切实可行。

目标不是生成更多的发现,而是为工程团队需要采取行动的发现提供更有力的证据。

与公开条目的比较(截至 2026 年 9 月 15 日)

截至 2026 年 9 月 15 日,展示的公开 CyberGym 条目包括:

系统 CyberGym 分数
Ostorlab Neutron 96.75%
Microsoft MDASH 91.0%
Wiz Atlas 90.9%
Mythos 83.1%

根据这些展示的分数,Ostorlab Neutron:

  • 比 Microsoft MDASH 高 5.7 个百分点
  • 比 Wiz Atlas 高 5.8 个百分点
  • 比 Mythos 高 13.6 个百分点

该比较仅针对上述特定的公开条目和评估结果。基准测试分数应始终结合用于得出这些分数的系统配置、模型、任务覆盖范围和验证要求来看待。

该结果证明了什么

CyberGym 衡量的是已知漏洞的复现能力。

智能体会被告知需要复现哪个历史漏洞,并获得相应的未修复源代码。它并不衡量在智能体没有任何漏洞存在提示的代码库中进行的开放式漏洞发现。

在这一明确定义的任务范围内,结果非常直接:

  • 1,507 个漏洞中的 1,507 个被检测并定位
  • 1,458 个已验证的差分 PoC
  • 96.75% 的已验证漏洞利用解决率
  • 每个任务 $1.0388 的平均估算推理成本
  • 分数高于截至 2026 年 9 月 15 日所展示的 Microsoft MDASH、Wiz Atlas 和 Mythos 条目

CyberGym 设定了一个明确的标准:证明必须能够运行。

这个分数之所以值得关注,是因为它背后的东西:可以独立执行和检验的可运行证据。

模型可以提示漏洞所在,Neutron 则将调查一直推进到证明。

如需了解完整的方法、系统架构、资源核算以及字节级的漏洞利用解析,请阅读 CyberGym 技术评估。

标签:

Security, CyberGym, Neutron