Ostorlab Neutron、CyberGymベンチマークで96.7%を達成
Ostorlab NeutronはCyberGymで検証済みエクスプロイト解決率96.7%を達成し、ベンチマークの脆弱性再現タスク1,507件のうち1,458件で実際に動作する差分概念実証を生成しました。
Ostorlab NeutronはCyberGymで検証済みエクスプロイト解決率96.75%を達成し、ベンチマークの1,507件のタスクのうち1,458件で実際に動作する差分実証を生成しました。
脆弱性の説明は出発点にすぎません。
CyberGymでは、AIセキュリティエージェントは疑わしいコードを特定したり、説得力のある説明を生成したりするだけでは合格できません。対象の脆弱性を再現する、実際に動作する概念実証(PoC)を生成する必要があります。
Ostorlab Neutronは1,507件中1,458件のタスクでこれを達成し、検証済みエクスプロイト解決率96.75%、四捨五入して96.7%という結果を得ました。
また、システムは1,507件のベンチマークタスクすべてで、根本にある脆弱性を検出し、その位置を特定しました。
評価にはDeepSeek V4 Flashを使用し、推定推論コストの平均はタスクあたり$1.0388でした。
| CyberGymにおけるOstorlab Neutron | 結果 |
|---|---|
| 検出し位置を特定した脆弱性 | 1,507 / 1,507 |
| 検証済みの差分PoC | 1,458 / 1,507 |
| 検証済みエクスプロイト解決率 | 96.75% |
| モデル | DeepSeek V4 Flash |
| 推定推論コストの平均 | タスクあたり$1.0388 |
CyberGymが評価するのは実際に動作する実証
CyberGymには、188のオープンソースソフトウェアプロジェクトにまたがる、ARVOとOSS-Fuzz由来の1,507件の過去の脆弱性が含まれています。
各タスクで、エージェントは既知の脆弱性の説明と、対応するパッチ未適用のソースコードを受け取ります。エージェントは、脆弱な挙動にどのように到達できるかを突き止め、それを引き起こす入力を生成しなければなりません。
その後、この実証はソフトウェアの2つのバージョンに対してテストされます。
パッチ未適用のビルドでは脆弱性を再現し、パッチ適用済みのビルドでは脆弱性を引き起こさないことが求められます。
もっともらしい説明では合格できません。両方のビルドをクラッシュさせる入力も合格できません。実証は特定の脆弱性を切り分け、パッチによってもたらされた挙動の違いを示す必要があります。
これが、Neutronの解決率96.75%の背後にある基準です。
成功したタスクの一例
評価のタスクの一つは、オープンソースのMPEG-4およびAACオーディオデコーダーであるFAAD2を対象としていました。
Neutronは、バージョン情報のないソースコードと、概略的な脆弱性の説明から作業を始めました。脆弱性がどのように修正されたかを示すパッチの差分やコミット履歴はありませんでした。
ベンチマークのハーネスは、通常のオーディオファイルを受け付けませんでした。脆弱なデコーダーに到達する前に、Neutronはハーネスが想定する独自のバイナリ構造を再構築する必要がありました。
Neutronは、Cの設定オブジェクトが必要とするメモリアラインメントを特定し、デコーダーに入るために必要な正確な29バイトのプリアンブルを構築しました。
続いてNeutronは、脆弱性の原因を不正な形式のProgram Configuration Elementまで突き止めました。この要素は、デコーダーの固定サイズのスタックバッファーが表現できる数を超えるオーディオチャンネルを宣言できるものでした。
Neutronは、デコードを続行するために必要なチェックを満たしつつ、64エントリのバッファーに対して93チャンネルを宣言する入力を構築しました。
最終的な概念実証は134バイトでした。
- 脆弱なビルドでは、この入力によってAddressSanitizerのスタックバッファーオーバーフローが確認されました。
- パッチ適用済みのビルドでは、同じ入力で正常に終了しました。
同じ入力で、脆弱なビルドはクラッシュし、パッチ適用済みのビルドはクラッシュしない。
これが、この結果を支える1,458件の動作する再現のうちの一つです。
推論はモデルが担い、調査はNeutronが完遂した
評価中に使用された基盤となる推論能力は、DeepSeek V4 Flashが提供しました。
それでも、CyberGymのタスクを完了するには、回答を生成する以上のことが必要でした。Neutronは、見慣れないソースコードを読み解き、対象の入力形式を理解し、有効なペイロードを構築し、それを実行し、その結果が脆弱なビルドとパッチ適用済みのビルドを区別できることを検証しなければなりませんでした。
したがって、このスコアは単独のモデルの応答ではなく、DeepSeek V4 Flashを使用したOstorlab Neutronシステム全体を反映したものです。
システムアーキテクチャの全体像、実験設定、エクスプロイトの手法については、CyberGymの技術評価で解説しています。
もう一つの成果は$1.0388
Ostorlab Neutronは、ベンチマークタスクあたり$1.0388という推定推論コストの平均で、検証済みエクスプロイト解決率96.75%に到達しました。
この数値には、Neutronが受理される差分PoCを生成できなかったタスクも含まれています。成功したエクスプロイト1件あたりのコストではありません。
この結果が重要なのは、脆弱性の検証が、最初の検出結果の後に続く高コストな工程であることが多いためです。
スキャナーは潜在的な問題を素早く特定できます。しかし、その問題が到達可能か、再現可能か、そしてパッチによって無効化されるかを確定するには、別途調査が必要になる場合があります。
推定推論コストの平均がタスクあたり1ドルをわずかに超える程度であれば、実行可能な検証をはるかに広い規模で実施することが現実的になります。
目的は、検出結果を増やすことではありません。エンジニアリングチームが対応を求められる検出結果について、より強力なエビデンスを生み出すことです。
公開エントリーとの比較(2026年9月15日時点)
2026年9月15日時点で、表示されていたCyberGymの公開エントリーには次のものが含まれていました。
| システム | CyberGymスコア |
|---|---|
| Ostorlab Neutron | 96.75% |
| Microsoft MDASH | 91.0% |
| Wiz Atlas | 90.9% |
| Mythos | 83.1% |
これらの表示スコアに基づくと、Ostorlab Neutronは次の位置にあります。
- Microsoft MDASHを5.7ポイント上回る
- Wiz Atlasを5.8ポイント上回る
- Mythosを13.6ポイント上回る
この比較は、これらの特定の公開エントリーと評価結果を対象としたものです。ベンチマークスコアは常に、それを得るために使用されたシステム構成、モデル、タスクのカバレッジ、検証要件とあわせて考慮すべきです。
この結果が示すもの
CyberGymが測定するのは、既知の脆弱性の再現です。
エージェントには、どの過去の脆弱性を再現すべきかが伝えられ、対応するパッチ未適用のソースコードが与えられます。脆弱性が存在するという手がかりがエージェントにないコードベースでの、制約のない脆弱性発見を測定するものではありません。
その定義されたタスクの範囲内において、結果は明快です。
- 1,507件中1,507件の脆弱性を検出し、位置を特定
- 1,458件の検証済み差分PoC
- 検証済みエクスプロイト解決率96.75%
- タスクあたりの推定推論コストの平均$1.0388
- 2026年9月15日時点で表示されていたMicrosoft MDASH、Wiz Atlas、Mythosのエントリーを上回るスコア
CyberGymは明確な基準を設けています。実証は実際に動作しなければなりません。
このスコアが注目に値するのは、その背後にあるもの、つまり実行して独立に検証できる、実際に動作するエビデンスがあるからです。
モデルは脆弱性を示唆できます。Neutronは調査を実証までやり遂げます。
手法の全体、システムアーキテクチャ、リソースの集計、バイト単位のエクスプロイトの解説については、CyberGymの技術評価をお読みください。