オープンソースのAIペンテストツール9選を比較(2026年)
PentestGPT、PentAGI、HexStrike AI、Strix、CAI、Nebula、NeuroSploit、Deadend CLI、RedAmonを比較し、各AIペンテストエージェントの主な機能、GitHubのスター数、ライセンスを紹介します。
要点
銀行アプリvulnbankを対象とした当社の実地テストでは、StrixとRedAmonが最も優れた結果を出しました。最も深くまで到達したのはRedAmonで、サーバーサイドの欠陥を連鎖させてアプリの完全な管理者権限を獲得しました。CAIもクリティカルな脆弱性を検出しましたが、その後アーカイブされています。PentestGPTとDeadend CLIは、設定したモデルではなくOpenAIを使い続け、PentAGIはセットアップが複雑で実行できず、NeuroSploitは起動に失敗しました。HexStrike AIを動かすにはClaudeやGPTなどの別のAIモデルが必要であり、Nebulaは単独でテストを行うのではなく、人間のテスターを支援するツールです。
自動スキャナーは、既知の問題を高速かつ確実に検出します。しかし、アプリが実際にどのように振る舞うかを把握すること、複数の弱点を連鎖させて一つの攻撃にまとめること、人間のようにテストの途中でアプローチを調整することはできません。
この隙間を埋めるために作られたのが、新しい世代のオープンソースAIペンテストツールです。これらのツールは大規模言語モデル(LLM)を使ってアプリケーションを探索し、次に何を攻撃するかを判断し、進めながら調整していきます。
ただし、AIペンテストツールという言葉が指すものは大きく異なります。完全自律型のエージェントもあれば、ClaudeやGPTなどの別のモデルから操作されて初めて機能するバックエンドもあり、単独のツールではなく人間のテスターを支援するアシスタントもあります。
ドキュメントだけではツールの実力はほとんど分からないため、当社は各ツールを実際に動かして評価しました。9つすべてをインストールし、同じ脆弱なアプリケーションであるvulnbank.orgに対して実行しました(RedAmonはローカルにホストしたそのコピーに対して実行)。本記事では各ツールについて、何ができるのか、GitHub上のプロジェクトの状況、そしてテストで得られた結果を紹介します。
この比較について
この比較記事は、商用のAIペンテスト製品を開発するOstorlabが公開しています。Ostorlab自身の製品は、ここで比較する9つのツールには含まれていません。ツールの説明と主な機能は、各プロジェクトの公開GitHubリポジトリとドキュメントに基づいています。GitHubの指標とプロジェクト情報は2026年10月6日時点の公開リポジトリを反映しており、「最終コミット」などの相対的な値はその日付を基準にしています。
評価基準:GitHubの指標(スター数、コミット数、コントリビューター数、最終コミット、ライセンス、技術スタック)、ドキュメントに記載された主な機能、そして各ツールをセットアップしてテスト対象のvulnbank.orgに対して実行できたかどうか、およびどのような検出結果が得られたか。
オープンソースAIペンテストツール一覧
- Pentest GPT
- PentAgi
- Hexstrike AI
- Strix
- Cybersecurity AI (CAI)
- Nebula
- Neurosploit
- Deadend CLI
- RedAmon
GitHub指標の比較
| ツール | スター数 | コミット数 | コントリビューター数 | 最終コミット | ライセンス | 技術スタック |
|---|---|---|---|---|---|---|
| PentestGPT | 15.7k+ | 307+ | 24+ | 約3か月前 | MIT | Python (94%), Shell (4%) |
| PentAGI | 25.2k+ | 950+ | 17+ | 約2日前 | MIT | Go (61%), TypeScript (36%) |
| HexStrike AI | 12.4k+ | 63+ | 2+ | 約2か月前 | MIT | Python (100%) |
| Strix | 66.7k+ | 900+ | 74+ | 24時間以内 | Apache-2.0 | Python (77%), Go (11%), TypeScript (9%) |
| CAI ⚠ (アーカイブ済み) |
9.8k+ | 1065+ | 93+ | アーカイブ済み(2026年8月) | MIT(OpenAI SDK由来のコード)+ 研究用途のみ(Alias Roboticsのコード) | Python (97%) |
| Nebula | 1.1k+ | 1468+ | 7+ | 24時間以内 | BSD-2-Clause | Python (61%), TypeScript (32%) |
| NeuroSploit | 1.4k+ | 268+ | 5+ | 約2日前 | MIT | Rust (84%), JavaScript (10%) |
| Deadend CLI | 311+ | 386+ | 5+ | 約2か月前 | AGPL-3.0 | Python (77%), Jinja (12%), TypeScript (7%) |
| RedAmon | 2.9k+ | 1343+ | 21+ | 24時間以内 | MIT | Python (58%), TypeScript (36%) |
1. PentestGPT
PentestGPTは、大規模言語モデル(LLM)を使ってペネトレーションテスト(ペンテスト)のプロセスの一部を自動化するために設計されたオープンソースのフレームワークです。
このツールは、相互に連携する3つのモジュールを使い、テスト全体の進捗を把握しながら攻撃チェーンを自動化します。
推論モジュール(Reasoning Module):全体の戦略を担う役割です。「タスクツリー」を維持して全体像を管理し、攻撃における次の論理的なステップを決定します。
生成モジュール(Generation Module):実行役として機能します。推論モジュールから戦略を受け取り、タスクの実行に必要な具体的なターミナルコマンドやスクリプトを作成します。
解析モジュール(Parsing Module):データアナリストの役割です。セキュリティツールが出力する雑然とした生の出力を整理し、最も重要な検出結果だけを抽出してシステムにフィードバックします。
この3部構成のシステムにより、PentestGPTは以前の結果を見失ったり、同じ処理の繰り返しに陥ったりすることなく、複雑な多段階の攻撃に対応できます。
主な機能:
PentestGPTの機能は、ペンテストの中でも特に難しい部分を自動化するために作られています。
自動推論エンジン:大規模言語モデルのロジックを活用して、複雑なペンテストのタスクやCapture The Flag(CTF)の課題を解きます。
動的なセッション追跡:テストプロセスのすべてのステップを記録し、リアルタイムで表示するライブウォークスルーを提供します。
分野横断のセキュリティ対応:Webセキュリティ、暗号、リバースエンジニアリング、フォレンジック、バイナリエクスプロイト(PWN)など、複数の専門カテゴリをカバーします。
ライブアクティビティ監視:ユーザーは、継続的なリアルタイムのフィードバックループを通じて、エージェントの推論と進捗を観察できます。
モジュール型のフレームワーク設計:拡張可能なアーキテクチャにより、新しいセキュリティツールやカスタマイズしたテストモジュールを組み込めます。
PentestGPTはドキュメントが少なく、内容も不明瞭です。セットアップ時、特定のプロバイダー(MoonshotAI)を指定してOpenRouter経由で実行しようとしましたが、ツールは常にOpenAIプロバイダーを使い続けました。手動でプロバイダーをMoonshotAIに強制的に切り替えたところ、初期化中に処理が止まり、長時間応答しない状態が続いたため、有効なテストを行えませんでした。
2. PentAGI
PentAGIは、複数のAIエージェントを連携させて複雑なセキュリティテストを実行する、オープンソースの自律型システムです。「マルチエージェント」方式を採用しており、調査、コーディング、インフラストラクチャといった専門のAIロールが協力して、脆弱性を自律的に発見、分析、悪用します。すべてのタスクは安全に隔離されたDocker環境で実行され、独自のブラウザーと検索システムを使ってリアルタイムの情報を収集し、人間の介入なしに攻撃戦略を適応させます。
主な機能:
PentAGIが提供する主な機能は次のとおりです。
完全自律型エージェント:人間の助けなしに、ペンテストの次のステップを自動的に判断して実行するAIシステムです。
安全なサンドボックス:すべての操作は隔離されたDocker環境内で実行され、ホストシステムを保護し、意図しない損害を防ぎます。
組み込みのセキュリティスイート:20種類以上のプロフェッショナル向けツール(Nmap、Metasploit、Sqlmapなど)を備えており、AIが自ら実行して結果を解釈できます。
スマートなメモリと検索:長期記憶システムを使って調査内容を保存し、Web検索エンジンと連携して最新のCVEデータを見つけます。
専門家チーム:「委任」システムを採用しており、調査、コーディング、インフラストラクチャといった特定のタスクにそれぞれ異なるAIエージェントが専念します。
モダンなWebダッシュボード:すっきりとしたインターフェースと詳細なログ機能を備え、AIの進捗と検出結果をリアルタイムで監視できます。
Pentagiはセットアップが長く複雑で、ドキュメントも少なく手順も不明瞭なため、vulnbank.orgに対してツールを実行するのは困難でした。
3. HexStrike AI
HexStrike AIは、LLMを150種類以上のセキュリティツールに接続するMCPサーバーです。AIエージェントが自らペンテストを実行し、脆弱性を発見し、バグバウンティのタスクを手動の入力なしに自動化できるようにします。要するに、ClaudeやGPTのようなモデルに、攻撃的セキュリティの作業を行うための「実践的な」ツールキットを与えるものです。
主な機能:
HexStrike AI MCPは、マルチエージェントアーキテクチャを使って自律的なテストと脆弱性データを処理します。
エージェント接続:ClaudeやGPTなどのモデルがFastMCPプロトコルを通じて接続し、コマンドを実行します。
ターゲット分析:意思決定エンジンがターゲットを評価し、具体的なテスト戦略とツールを選択します。
自律実行:エージェントが手動の介入なしに、さまざまな環境でセキュリティ評価を実行します。
システムの適応:結果や発見された脆弱性に基づいて、プラットフォームがテストロジックをリアルタイムで更新します。
技術レポート:最終出力として、脆弱性カードとリスク分析データを生成します。
HexStrike AIはMCPサーバーであり、単独で動作するエンジンではありません。動かすにはClaudeやGPTのような外部のAIクライアントが必要なため、当社は自律型のテスターとしてvulnbank.orgに対して実行しませんでした。
4. Strix
Strixは、動的な環境でコードを実行することで人間の攻撃者の振る舞いをシミュレートするように設計された、自律型エージェントのフレームワークです。セキュリティ上の欠陥を特定し、実際に動作する概念実証(PoC)エクスプロイトを生成することでその妥当性を確認します。このアプローチにより、開発者とセキュリティチームは検証済みの結果を得られ、ペンテストに必要な手作業と、静的スキャンにつきもののノイズを減らせます。
主な機能:
自動化されたアプリケーションセキュリティ:Strixは統合されたハッカー向けツールキットを活用し、コード内のクリティカルな脆弱性を動的に検出して検証します。アプリケーションをリアルタイムで実行することで、静的ツールが見逃す実行時の欠陥を発見し、概念実証のエビデンスで裏付けます。
迅速なオンデマンドペンテスト:連携して動くエージェントのチームを展開することで、インフラストラクチャ全体にスケールし、数週間ではなく数時間でペンテストを完了します。この自律的なスケールにより、組織はコンプライアンス対応のレポートとリスク分析をオンデマンドで作成できます。
バグバウンティの調査と検証:初期の発見からエクスプロイトの生成まで、バグハンティングのプロセスをエンドツーエンドで自動化します。バグを自律的に発見し、実際に動作するPoCを作成することで調査にかかる手作業の負担をなくし、報告と報奨金の獲得を早めます。
DevSecOpsとCI/CDの連携:開発者を第一に考えたCLIにより、CI/CDパイプラインにシームレスに組み込めます。これにより、脆弱性が本番環境に到達する前に自律的にブロックし、自動修正の提案と実行可能なレポートをエンジニアリングチームに直接提供します。

Strixフレームワークをvulnbank.orgに対して実行したところ、次のような複数のクリティカルな脆弱性を特定しました。
- /loginエンドポイントにおけるブラインドSQLインジェクションを、タイミングベースの手法で確認(CVSS 10.0)
- データベースのコネクションプールが枯渇し続け、バックエンドのインフラストラクチャが著しく劣化
- AIチャットシステムが稼働しており、APIバックエンドの詳細を漏えい(DeepSeekとの連携)
- インフラストラクチャの障害により、ドキュメントに記載された複数の脆弱性にアクセス不可
- 40以上のエンドポイントを特定し、アタックサーフェスを包括的にマッピング
5. Cybersecurity AI (CAI)
⚠ 更新(2026年10月):当社のテスト以降、CAIはアーカイブされ、ライセンスが変更されました。OpenAIのAgents SDKから借用したコードのみがMITのままで、CAIの開発元であるAlias Roboticsが書いたコードはすべて研究用途のみとなり、商用ライセンスなしでの商用利用や本番環境での利用は認められていません。インストールして実行することは引き続き可能ですが、メンテナンスはされていません。以下の結果は、完全なオープンソースだった時期に当社が実施した当初のテストによるものです。
CAIは、攻撃と防御のセキュリティタスクのためのAIエージェントを構築・展開するためのオープンソースのフレームワークです。開発者や研究者が脆弱性の発見、悪用、緩和を自動化するためのモジュール型の環境を提供します。さまざまな組織で使われており、専門的なセキュリティエージェントを作成するための標準化されたインフラストラクチャとして機能します。
主な機能:
CAIフレームワークは、AIモデルと実践的なセキュリティ運用の間の溝を埋めるために設計された、モジュール型の機能群を提供します。
幅広いモデル連携:CAIは、OpenAI、Anthropic、DeepSeek、そしてOllamaによるローカル展開を含む、300以上のモデルをネイティブにサポートしています。
統合された攻撃用ツールセット:偵察、脆弱性の悪用、権限昇格(不正に管理者レベルの制御を得ること)のための事前設定済みツールを備え、セキュリティワークフローを効率化します。
検証済みの性能:アーキテクチャは、CTF環境、バグバウンティプログラム、プロフェッショナルなセキュリティ評価での実践的な適用を通じて検証されています。
モジュール型エージェントアーキテクチャ:タスク特化型のフレームワークを採用しており、ユーザーは個別のセキュリティ目標に合わせた専門エージェントを構築・展開できます。
実行のガードレール:組み込みのセキュリティプロトコルにより、プロンプトインジェクションや、許可されていないコマンドや危険なコマンドの実行から環境を保護します。
コミュニティの研究重視:研究を第一に考えたプラットフォームとして設計されており、AIを活用したサイバーセキュリティツールを標準化し、広くコミュニティにオープンに提供することを目指しています。

CAIフレームワークをvulnbank.orgに対して実行したところ、次のような重大度が高およびクリティカルの脆弱性を複数特定しました。
-
認証バイパスとアカウントの完全な乗っ取りを可能にするSQLインジェクション
-
リモートコード実行につながる可能性のある、露出したWerkzeugデバッガー
-
アカウントをまたいだデータアクセスを可能にする安全でないオブジェクト直接参照
-
不正な資金移動を可能にする、制限のない送金機能
-
大規模な不正や悪用を可能にする、無制限のアカウント登録
-
アプリケーションの内部ロジックを開示する詳細なエラーメッセージ
-
セッションと権限の悪用につながるJWTトークンインジェクションの問題
6. Nebula
Nebulaは、大規模言語モデルをコマンドラインインターフェースに直接統合したオープンソースのペンテストアシスタントです。偵察、脆弱性分析、セッションの記録といった技術的なタスクを自動化します。ターミナルの出力をリアルタイムで解釈することで、さらなるテストのための提案を行い、検出結果とコマンド履歴の自動ログを維持します。
主な機能:
Nebulaは、セキュリティ診断におけるデータ収集と記録のフェーズを自動化する、包括的なAI強化機能群を提供します。
エージェント型のインターネット検索:AIエージェントを使ってWebからリアルタイムのサイバーセキュリティの文脈やニュースを取得し、新たに出現したクラウドマルウェアVoidLinkや、最近公開されたGogs RCEのゼロデイなど、最新の動向をユーザーが把握できるようにします。
自動メモ作成:技術的な検出結果の記録と分類を行い、手動の介入なしにCWEやNISTなどのセキュリティ標準に対応付けます。
コンテキストを踏まえたインサイト:セキュリティツールのターミナル出力をライブで分析し、具体的な脆弱性の発見手法や悪用手法など、次のステップをすぐに提案します。
複数ソースからのツール連携:外部の偵察ツールやスキャンツールからデータをインポートして分析を一元化し、AIによる修復のアドバイスを生成できます。
統合されたエビデンス取得:コマンド画面から直接スクリーンショットを撮影したり、簡単なメモやハイライトを追加したりするツールを備えています。これにより、最終レポートに必要な実証材料をはるかに速く集められます。
操作ログ:実行されたすべてのコマンドを手動の技術メモとともに自動的に記録し、包括的な監査証跡として完全なセッション履歴を維持します。
ライブアクティビティフィード:リアルタイムのステータスパネルが進行中のアクティビティと診断の進捗を監視し、5分ごとに更新してテストフェーズを順調に進められるようにします。
Nebulaは対話型のAIターミナルアシスタントであり、自律型のペンテストツールではないため、ターゲットに対して完全に自律的に実行することはできません。単独で検出結果を生み出すのではなく、コマンド、ペイロード、分析を支援することで、人間主導のテストを補助するために使われます。
7. NeuroSploit
NeuroSploitは、攻撃的セキュリティのタスクのさまざまな側面を自動化・強化するために作られた、AIによるペンテストのエコシステムです。大規模言語モデル(LLM)の力を活用し、ターゲット分析、脆弱性検出、悪用計画、防御支援を担う専用のエージェントペルソナを提供します。運用セキュリティと倫理基準を重視して維持されています。
主な機能:
NeuroSploitは、ハッキングのための賢い「アシスタント」です。AIの「頭脳」(LLM)を使って、セキュリティ専門家の作業のうち退屈な部分の自動化を支援します。スキャンを一つずつ実行するだけでなく、専門のAIエージェントを使って攻撃を計画し、弱点を見つけ、防御をテストすることで、人間が手作業で行うよりもはるかに速く作業を進めます。
専門エージェントのエコシステム:ロールベースのシステムを使い、攻撃シミュレーションのためのレッドチーム、防御監査のためのブルーチーム、脅威調査のためのマルウェア分析など、特定の業務に合わせたエージェントを展開します。
マルチモデルとローカル実行:Gemini、Claude、GPTを含む幅広いLLMプロバイダーと連携し、LM StudioとOllamaをネイティブにサポートしているため、完全にローカルでプライベートな実行が可能です。
ツールの自動オーケストレーション:Nmap、Metasploit、Nucleiなどの外部セキュリティツールを連鎖させ、AIエージェントが複雑な偵察と悪用のワークフローを自律的に管理できるようにします。
脆弱性の検証とインテリジェンス:単純なスキャンにとどまらず、OSINTコレクターとDNS列挙ツールを組み込んでおり、ターゲットの情報を収集して、ラテラルムーブメントと永続化のテストを実行します。
高精度なレポートとガードレール:プロフェッショナルな結果を得るために、構造化されたHTMLとJSONのレポートを生成し、グラウンディングと自己反省の手法を用いてAIのハルシネーションと誤検知(フォールスポジティブ)を最小限に抑えます。
NeuroSploitは初期化中の問題により正常に起動できず、テストの実行や意味のある結果を得ることができませんでした。
8. Deadend CLI
Deadend CLIは、自己修正によってセキュリティ上のブロックを乗り越えるペンテスト用の自律型エージェントです。従来型の攻撃が失敗すると、エージェントはエラーレスポンスを読み取ってどのような防御が働いているかを把握し、それを回避するための独自のPythonコードを書きます。行動と学習を繰り返すこのサイクルにより、ターゲットへの侵入に成功するまで、リアルタイムで戦術を進化させます。
主な機能:
Deadend CLIは、ローカルで自律的なWebペンテストを可能にするための、特定のアーキテクチャ上の機能を活用しています。
ローカル実行:クラウドへの依存なしにローカルのインフラストラクチャ上で完全に動作するため、セキュリティ評価中のデータ持ち出しはゼロです。
柔軟なLLMサポート:特定のプロバイダーに縛られることなく、展開可能なあらゆる大規模言語モデルと互換性を持つように設計されています。
サンドボックス化されたツール連携:Playwright、Docker、WebAssemblyを含む独自のサンドボックス環境を利用して、テストツールを安全に実行します。
スーパーバイザーとサブエージェントの設計:シンプルな階層構造を採用しており、「スーパーバイザー」AIが全体像を管理し、「サブエージェント」に具体的な作業を割り当てます。これにより複雑なタスクが整理され、適切なAIが適切なタイミングで適切な作業を担うようになります。
スマートな意思決定:AIは単に推測するのではなく、「信頼度フィルター」を使います。行動を起こす前に、成功をどの程度確信しているかを確認します。そのスコアに応じて、先に進むか(緑)、別のアプローチを試すか(黄)、立ち止まって事実を再確認するか(赤)を判断します。
Deadend CLIをGeminiを使うように設定したにもかかわらず、ツールはOpenAIプロバイダーを使い続けました。OpenAIは設定していなかったため実行は失敗し、テスト対象に対してツールを有効に使うことができませんでした。
9. RedAmon
RedAmonは、偵察、悪用、ポストエクスプロイトを一つの自律型パイプラインに連鎖させる、オープンソースでセルフホスト型のAIペンテストフレームワークです。ポストエクスプロイトとは、攻撃者が侵入した後に行う行為のことで、さらなる権限の獲得や、同じネットワーク上の他のマシンへの到達などが含まれます。
ターゲットのアタックサーフェスをグラフデータベース(Neo4j)にマッピングし、隔離されたDockerコンテナ内でセキュリティスキャナーを並列に実行して、AIエージェントで検出結果を検証します。
さらに、このリストにある大半のツールよりも一歩踏み込んでいます。修復エンジンのCypherFixを通じて、コードの修正を書き、ターゲットのリポジトリに直接プルリクエストを作成できます。自律的なフェーズの間には、人間による承認のゲートが置かれています。
ホスト側の前提条件はDockerだけです。フレームワークは./redamon.sh installコマンド一つでインストールでき、約4 GBのRAMと80 GBのディスクを必要とします。
主な機能:
アタックサーフェスグラフ:RedAmonはターゲットをNeo4jのナレッジグラフにマッピングするため、エージェントは検出結果を個別に扱うのではなく、ホスト、サービス、脆弱性の間の関係をもとに推論できます。
並列化された偵察パイプライン:GVM/OpenVASによる脆弱性スキャンを含む40以上の統合セキュリティツールをファンアウト/ファンインのパターンで連携させます。すべてコンテナ内で動作するため、ホストには何もインストールされません。
AIエージェントオーケストレーター:LangGraphベースのオーケストレーターが、情報収集、悪用、ポストエクスプロイトの各段階にわたるフェーズベースの実行を進め、フェーズ間には人間による承認のゲートを設けています。
CypherFix修復エンジン:検出にとどまらず、RedAmonは各検出結果をトリアージし、コードの修正を生成して、接続されたリポジトリにプルリクエストを作成することで、ワークフローを修復まで拡張します。
柔軟なLLMサポート:Ollamaによるローカルモデル、またはOpenAI、Anthropic、AWS Bedrockなどのクラウドプロバイダーで動作し、プロジェクトごとに幅広いモデルを選択できます。
セルフホスト型でコンテナ化:スタック全体がDockerを通じて自社のインフラストラクチャ上で動作するため、評価データはローカルに保たれます。

当社はRedAmonを、公開サイトではなく、vulnbank.orgの基になっているオープンソースアプリケーションをローカルにホストしたvulnbankのコピーに対して実行しました。約14分間の自律的な偵察の後、エージェントは次のような複数のクリティカルな脆弱性を特定しました。
- エラーベースのデータ抽出によるSQLインジェクションを確認。最初の試行が失敗した際、エージェントは自らペイロードの解析を修正しました。
- プロフィール画像のアップロードにおけるSSRF(サーバーサイドリクエストフォージェリ。攻撃者が選んだURLをサーバーに取得させる攻撃)。内部専用のエンドポイントへの到達に使われ、JWTの署名シークレット、Flaskのシークレットキー、データベースの認証情報が漏えいしました。
- 管理者トークンの偽造:漏えいしたシークレットを使い、エージェントは自らJWT(ログイン済みユーザーを識別するためにアプリが使うトークン)に管理者として署名し、新しい管理者アカウントを作成しました。
127.1や16進表記など、localhostアドレスの別表記を使ったSSRFフィルターのバイパス- すべてのAPIエンドポイントを記述したOpenAPI仕様の露出。エージェントはこれを使ってエクスプロイトチェーンを構築しました。
- アカウントの内部情報を漏えいし、レスポンスで認証情報をそのまま返す登録エンドポイント
- 漏えいした内部設定を通じた、デバッグモードの有効化とレート制限設定の開示
各検出結果は、HTTPのエビデンスと信頼度スコアとともにグラフに保存され、個別に列挙されるのではなく、攻撃経路の中に結び付けられます。
この比較の限界
- オープンソースプロジェクトは急速に変化します。GitHubの指標、機能、ドキュメント、セットアップ時の挙動は、2026年10月6日以降に変わっている可能性があります。
- 実地テストの結果は、意図的に脆弱に作られた単一のアプリケーションであるvulnbank.orgに対するテストから得られたものです。独立したベンチマークではなく、他のターゲット、LLMプロバイダー、ツールのバージョンでは結果が異なる場合があります。
- RedAmonは公開サイトのvulnbank.orgではなく、同じアプリケーションをローカルにホストしたコピーに対してテストしたため、他のテスト中に公開サイトで発生した可用性の問題の影響を受けていません。
- セットアップと実行の失敗は、本記事のためにテスト時点で試した設定を反映したものであり、今後のリリースや別の設定では解消される可能性があります。
- HexStrike AIとNebulaは、上記の各セクションで説明したとおり、自律型のテスターとしては実行していません。
- ツールを選ぶ前に、各プロジェクトのリポジトリとドキュメントで現在の機能を確認してください。
まとめ
当社は9つのオープンソースAIペンテストツールを比較し、銀行のWebアプリケーション(vulnbank.org)に対して実行して、その有効性を評価しました。
StrixとCybersecurity AI (CAI)は実用的な結果を出し、SQLインジェクション、認証バイパス、安全でないオブジェクト参照などのクリティカルな脆弱性を確認して、概念実証のエクスプロイトを生成しました。ただし、CAIはその後アーカイブされており、現在は積極的にメンテナンスされていない点に注意してください。
RedAmonは、今回のツールの中で最も深い結果を出しました。エージェントは複数の弱点を連鎖させて一つの攻撃にまとめました。SSRFでアプリのシークレットを漏えいさせ、それを使って管理者トークンを偽造し、自身の管理者アカウントを作成したのです。SQLインジェクションも確認しました。
PentestGPT、PentAGI、NeuroSploit、Deadend CLIは、初期化の失敗、データベースのエラー、LLMプロバイダーの設定ミスなど、セットアップや実行の問題に直面し、テストを有効に完了できませんでした。
HexStrike AIはMCPサーバーとして機能するため、テストをオーケストレーションするには互換性のあるAIクライアントが必要です。一方、NebulaはAI支援型のターミナルツールとして動作し、ガイダンスや次のステップの提案によって人間主導のテストを支援しますが、自律的には動作しません。
全体として、当社のテストで最も優れた結果を出したのはStrixとRedAmonでした。RedAmonは約4 GBのRAMと80 GBのディスクを必要とし、展開が最も重いツールですが、CypherFixを通じて修正のプルリクエストを作成するところまで踏み込むのは、ここで紹介したツールの中でRedAmonだけです。CAIも当社のテストでは優れた結果を出しましたが、その後アーカイブされているため、新たに導入する場合は、積極的にメンテナンスされている代替ツールと比較検討する必要があります。その他のツールも、環境やセットアップに応じて、研究、実験、支援型のワークフローに引き続き役立ちます。