我们的 AI 引擎 Neutron 在加州大学伯克利分校的 CyberGym 基准测试中取得了 96.75% 的成绩。 了解更多

安全

安全

9 款开源 AI 渗透测试工具横评(2026)

对 PentestGPT、PentAGI、HexStrike AI、Strix、CAI、Nebula、NeuroSploit、Deadend CLI 和 RedAmon 进行横评:逐一介绍各款 AI 渗透测试智能体的关键特性、GitHub star 数和许可证。

核心要点
在我们针对 vulnbank 银行应用进行的实测中,Strix 和 RedAmon 的表现最为出色。RedAmon 走得最远,把一个服务器端缺陷串联起来,取得了对该应用的完整管理员访问权限。CAI 也发现了严重漏洞,但此后已被归档。PentestGPT 和 Deadend CLI 反复回退到 OpenAI,而不是我们配置的模型;PentAGI 复杂的部署过程让我们无法运行它;NeuroSploit 则启动失败。HexStrike AI 需要一个独立的 AI 模型(如 Claude 或 GPT)来驱动它,而 Nebula 是辅助人工测试人员,而非自行测试。


自动化扫描器在捕捉已知问题方面既快又可靠。但它们做不到的是:看清一个应用实际如何运行、把多个弱点串联成一次攻击,或者像人类那样在测试中途调整思路。

新一波开源 AI 渗透测试工具正是为弥补这一差距而生。它们利用大语言模型来探索应用、决定下一步攻击什么,并随进展不断调整。

但AI 渗透测试工具这个术语涵盖了相当不同的东西:有些是完全自主的智能体,有一个是只有在被独立模型(如 Claude 或 GPT)驱动时才能工作的后端,还有一个则是面向人工测试人员的助手,而非独立工具。

仅凭文档很难看出这些工具的实际表现,因此我们对每一款都进行了实测。我们安装了全部九款工具,并针对同一个存在漏洞的应用 vulnbank.org 运行它们(RedAmon 针对的是它的本地托管副本)。对于每一款工具,本文都会介绍它的功能、它在 GitHub 上的项目面貌,以及它在测试中产出的结果。

关于本次横评

本次横评由 Ostorlab 发布,我们开发一款商业化的 AI 渗透测试产品。Ostorlab 自己的产品并不在此处横评的九款工具之列。工具描述和关键特性均基于各项目公开的 GitHub 仓库和文档。GitHub 指标和项目信息反映的是截至 2026 年 10 月 6 日的公开仓库状态;诸如"最近提交"之类的相对数值均以该日期为基准。

评估标准: GitHub 指标(star 数、提交数、贡献者数、最近提交、许可证和技术栈)、已记录的关键特性,以及每款工具能否被成功部署并针对测试目标 vulnbank.org 运行、产出了什么检测结果。

开源 AI 渗透测试工具清单

  1. Pentest GPT
  2. PentAgi
  3. Hexstrike AI
  4. Strix
  5. Cybersecurity AI (CAI)
  6. Nebula
  7. Neurosploit
  8. Deadend CLI
  9. RedAmon

GitHub 指标对比

工具 Star 数 提交数 贡献者数 最近提交 许可证 技术栈
PentestGPT 15.7k+ 307+ 24+ 约 3 个月前 MIT Python (94%), Shell (4%)
PentAGI 25.2k+ 950+ 17+ 约 2 天前 MIT Go (61%), TypeScript (36%)
HexStrike AI 12.4k+ 63+ 2+ 约 2 个月前 MIT Python (100%)
Strix 66.7k+ 900+ 74+ 24 小时内 Apache-2.0 Python (77%), Go (11%), TypeScript (9%)
CAI ⚠
(已归档)
9.8k+ 1065+ 93+ 已归档(2026 年 8 月) MIT(OpenAI SDK 代码)+ 仅限研究用途(Alias Robotics 代码) Python (97%)
Nebula 1.1k+ 1468+ 7+ 24 小时内 BSD-2-Clause Python (61%), TypeScript (32%)
NeuroSploit 1.4k+ 268+ 5+ 约 2 天前 MIT Rust (84%), JavaScript (10%)
Deadend CLI 311+ 386+ 5+ 约 2 个月前 AGPL-3.0 Python (77%), Jinja (12%), TypeScript (7%)
RedAmon 2.9k+ 1343+ 21+ 24 小时内 MIT Python (58%), TypeScript (36%)

1. PentestGPT

PentestGPT 是一个开源框架,旨在利用大语言模型(LLM)来自动化渗透测试流程的各个部分。

该工具使用三个相互交互的模块来自动化攻击链,同时追踪整体测试进度:

推理模块(Reasoning Module): 充当首席策略师。它维护一棵"任务树"来把控全局,并决定攻击中下一个合乎逻辑的步骤。

生成模块(Generation Module): 充当执行者。它接收来自推理模块的策略,并生成执行任务所需的具体终端命令或脚本。

解析模块(Parsing Module): 充当数据分析师。它整理来自安全工具的原始、杂乱的输出,只提取最重要的发现并反馈回系统。

借助这个三段式系统,PentestGPT 能够处理复杂的多阶段攻击,而不会丢失此前的结果或陷入重复的循环。


关键特性:

PentestGPT 的各项特性旨在自动化渗透测试中最困难的部分:

自动化推理引擎: 该平台利用大语言模型的逻辑能力来解决复杂的渗透测试任务和夺旗赛(CTF)挑战。

动态会话追踪: 该系统提供实时演示,记录并展示测试过程中的每一步。

跨领域安全支持: 它涵盖多个专门类别,包括 Web 安全、密码学、逆向工程、取证,以及二进制漏洞利用(PWN)。

实时活动监控: 用户可以通过持续的实时反馈循环观察智能体的推理与进展。

模块化框架设计: 其可扩展的架构允许集成新的安全工具和定制化的测试模块。

PentestGPT 的文档有限且不够清晰。在部署过程中,我们尝试通过 OpenRouter 使用某个特定的供应商(MoonshotAI)运行它,但该工具始终回退到 OpenAI 供应商。 在手动强制将供应商切换为 MoonshotAI 后,该工具在初始化阶段卡住,长时间无响应,导致无法进行有效测试。

2. PentAGI

PentAGI 是一个开源、自主的系统,它协调多个 AI 智能体来执行复杂的安全测试。它采用"多智能体"方法,让研究、编码、基础设施等专门的 AI 角色协同工作,独立地发现、分析和利用漏洞。该工具在一个安全隔离的 Docker 环境中执行所有任务,使用自带的浏览器和搜索系统来收集实时情报,并在无人工干预的情况下调整其攻击策略。


关键特性:

以下是 PentAGI 提供的主要特性:

完全自主的智能体: 一个由 AI 驱动的系统,无需人工帮助即可自动确定并执行渗透测试的下一步。

安全沙箱: 所有操作都在一个隔离的 Docker 环境中运行,以保障宿主系统安全并防止任何意外损坏。

内置安全工具套件: 包含 20 多款专业工具(如 Nmap、Metasploit 和 Sqlmap),AI 可以自行运行并解读它们。

智能记忆与搜索: 使用长期记忆系统来存储研究成果,并与网络搜索引擎集成以查找最新的 CVE 数据。

专家团队: 使用一套"委派"系统,让不同的 AI 智能体专注于研究、编码或基础设施等特定任务。

现代化 Web 控制台: 具备简洁的界面和详尽的日志,让您可以实时监控 AI 的进展和发现。

Pentagi 的部署过程冗长而复杂,文档有限、说明不清,使得我们难以针对 vulnbank.org 运行该工具。

3. HexStrike AI

HexStrike AI 是一个 MCP 服务器,它把 LLM 连接到 150 多款安全工具。它让 AI 智能体能够自行运行渗透测试、发现漏洞,并在无需人工输入的情况下自动化漏洞赏金任务。本质上,它为 Claude 和 GPT 等模型提供了一套"动手"的工具箱,用以执行进攻性安全工作。


关键特性:

HexStrike AI MCP 采用多智能体架构来处理自主测试和漏洞数据。

智能体连接: Claude 和 GPT 等模型通过 FastMCP 协议连接以执行命令。

目标分析:决策引擎评估目标,以选择特定的测试策略和工具。

自主执行:智能体在各类环境中执行安全评估,无需人工干预。

系统自适应: 该平台根据结果和已发现的漏洞实时更新其测试逻辑。

技术化报告:该系统生成漏洞卡片和风险分析数据作为最终输出。

HexStrike AI 是一个 MCP 服务器,而非独立引擎。它需要一个外部 AI 客户端(如 Claude 或 GPT)来驱动,因此我们没有把它作为自主测试工具针对 vulnbank.org 运行。

4. Strix

Strix 是一个自主智能体框架,旨在通过在动态环境中执行代码来模拟人类攻击者的行为。它识别安全缺陷,并通过生成可用的概念验证漏洞利用代码来确认其有效性。这种方式为开发者和安全团队提供经过验证的结果,减少了渗透测试所需的人工投入,以及静态扫描通常伴随的噪声。


关键特性:

自动化应用安全: Strix 利用集成的黑客工具箱,动态地检测并验证代码中的严重漏洞。通过实时运行应用,它能发现静态工具遗漏的运行时缺陷,并以概念验证证据加以确认。

快速按需渗透测试: 通过部署多支协作的智能体团队,该系统可横跨整个基础设施进行扩展,在数小时而非数周内完成渗透测试。这种自主扩展能力让组织能够按需生成符合合规要求的报告和风险分析。

漏洞赏金研究与验证:该平台把从初始发现到漏洞利用生成的整个漏洞挖掘流程自动化。它通过自主发现漏洞并创建所需的可用 PoC,省去了研究中的人工开销,从而更快地报告并获得奖励。

DevSecOps 与 CI/CD 集成: 一款开发者优先的 CLI 允许无缝嵌入 CI/CD 流水线。这使得该系统能够在漏洞进入生产环境之前自主拦截它们,并直接向工程团队提供自动修复建议和可操作的报告。

Strix 报告检测结果的截图
Strix 检测结果报告

我们针对 vulnbank.org 运行了 Strix 框架,识别出了多个严重漏洞,包括:

  • 在 /login 端点确认的盲 SQL 注入,并通过基于时间的方式加以确认。(CVSS 10.0)
  • 后端基础设施严重退化,数据库连接池持续耗尽。
  • AI 聊天系统处于运行状态,并泄露了 API 后端细节。(DeepSeek 集成)
  • 由于基础设施故障,多个已记录的漏洞无法访问。
  • 全面绘制了攻击面,识别出 40 多个端点。

5. Cybersecurity AI (CAI)

⚠ 更新(2026 年 10 月): 在我们测试之后,CAI 已被归档并重新授权。只有它从 OpenAI 的 Agents SDK 借用的代码仍保持 MIT 许可;由 CAI 背后的公司 Alias Robotics 编写的所有代码现在均为仅限研究用途,未经商业许可不得用于任何商业或生产用途。它仍可安装和运行,但已不再维护。以下结果来自我们最初的测试,当时它还是完全开源的。

CAI 是一个开源框架,用于构建和部署面向进攻性与防御性安全任务的 AI 智能体。它为开发者和研究人员提供一个模块化环境,以自动化漏洞发现、利用和缓解。该框架被各类组织所采用,充当创建专门安全智能体的标准化基础设施。


关键特性:

CAI 框架提供了一组模块化特性,旨在弥合 AI 模型与实际安全操作之间的鸿沟。

广泛的模型集成:CAI 原生支持 300 多款模型,包括 OpenAI、Anthropic、DeepSeek,以及通过 Ollama 进行的本地部署。

集成的进攻性工具集:该框架包含用于侦察、漏洞利用和权限提升(获取未经授权的管理员级别控制权)的预配置工具,以简化安全工作流。

经过验证的性能:该架构已通过在 CTF 环境、漏洞赏金项目和专业安全评估中的实际应用得到验证。

模块化智能体架构:该系统采用一个任务专属的框架,让用户能够构建和部署针对不同安全目标量身定制的专门智能体。

执行护栏:内置的安全协议保护环境免受提示词注入以及未经授权或危险命令的执行。

社区研究导向:该框架被设计为一个研究优先的平台,旨在为更广泛的社区标准化并开放获取由 AI 驱动的网络安全工具。

CAI 报告检测结果的截图
CAI 检测结果报告

我们针对 vulnbank.org 运行了 CAI 框架,识别出了多个高危和严重漏洞,包括:

  • SQL 注入,可实现身份验证绕过和完整的账户接管

  • 暴露的 Werkzeug 调试器,可能导致远程代码执行

  • 不安全的直接对象引用,允许跨账户数据访问

  • 不受限制的转账功能,可实现未经授权的资金转移

  • 不受限制的账户注册,可实现大规模欺诈和滥用

  • 冗长的错误信息,泄露内部应用逻辑

  • JWT 令牌注入问题,导致会话和权限滥用

6. Nebula

Nebula 是一个开源渗透测试助手,它把大语言模型直接集成到命令行界面中。它自动化诸如侦察、漏洞分析和会话记录等技术性任务。通过实时解读终端输出,该工具会提供建议以指导后续测试,并维护一份自动化的发现与命令历史日志。


关键特性:

Nebula 提供了一整套 AI 增强特性,用以自动化安全项目中的数据收集和记录阶段。

智能体式互联网搜索:该工具使用 AI 智能体从网络上拉取实时的网络安全上下文和新闻,确保用户了解最新趋势,比如新兴的 VoidLink 云端恶意软件,或最近披露的 Gogs RCE 零日漏洞。

自动化笔记:Nebula 负责记录和分类技术发现,并在无需人工干预的情况下将其映射到 CWE 和 NIST 等安全标准。

上下文感知洞察:该系统分析来自安全工具的实时终端输出,并立即为下一步提供建议,例如具体的漏洞发现或利用技术。

多来源工具集成:用户可以从外部侦察和扫描工具导入数据,以集中进行分析并生成由 AI 驱动的修复建议。

集成证据采集:该平台包含可直接从命令行界面截取屏幕截图以及添加快速笔记或标注的工具。这使得为最终报告收集所需证据变得快得多。

操作日志:该系统通过自动记录所执行的每一条命令以及人工填写的技术笔记,维护一份完整的审计轨迹,以形成完整的会话历史。

实时活动流:一个实时状态面板监控正在进行的活动和项目进展,每五分钟刷新一次,以保证各测试阶段按计划推进。

Nebula 是一个交互式 AI 终端助手,而非自主的渗透测试工具,因此无法完全自主地针对目标运行。它用于辅助人工主导的测试,提供命令、载荷和分析方面的协助,而非独立产出检测结果。

7. NeuroSploit

NeuroSploit 是一个由 AI 驱动的渗透测试生态系统,旨在自动化并增强进攻性安全任务的多个方面。借助大语言模型(LLM)的能力,该框架提供专门的智能体角色,能够进行目标分析、漏洞检测、漏洞利用规划和防御支持,并始终注重运营安全(OpSec)和道德规范。


关键特性:

NeuroSploit 是一个用于黑客作业的智能"助手"。它用一个 AI "大脑"(LLM)来帮助安全专家自动化工作中枯燥的部分。它不再只是一次运行一个扫描,而是使用专门的 AI 智能体来规划攻击、寻找薄弱点、测试防御,速度远超人工手动操作。

专门的智能体生态系统: 该框架采用基于角色的系统来部署为特定作业量身定制的智能体,例如用于攻击模拟的红队、用于防御审计的蓝队,或用于威胁检查的恶意软件分析。

多模型与本地执行: 它集成了众多 LLM 供应商,包括 Gemini、Claude 和 GPT,并原生支持 LM Studio 和 Ollama,以实现完全本地、私密的执行。

自动化工具编排: 该系统可以把 Nmap、Metasploit 和 Nuclei 等外部安全工具串联起来,让 AI 智能体能够自主管理复杂的侦察和漏洞利用工作流。

漏洞验证与情报: 除简单扫描外,该平台还内置 OSINT 采集器和 DNS 枚举器,用以收集目标情报并执行横向移动和持久化测试。

高保真报告与护栏: 为确保专业的结果,该框架生成结构化的 HTML 和 JSON 报告,同时运用接地(grounding)和自我反思技术来尽量减少 AI 幻觉和误报。

NeuroSploit 因初始化过程中出现问题而无法正常启动,这导致它无法运行测试或产出有意义的结果。

8. Deadend CLI

Deadend CLI 是一个用于渗透测试的自主智能体,它通过自我纠正来突破安全阻拦。当一次传统攻击失败时,该智能体会读取错误响应以理解具体的防御措施,然后编写定制的 Python 代码来绕过它。这种"行动—学习"的持续循环让该工具能够实时演进其战术,直到成功攻破目标。


关键特性:

Deadend CLI 利用一组特定的架构特性,实现本地、自主的 Web 渗透测试。

本地执行: 该系统完全在本地基础设施上运行,不依赖任何云服务,确保安全评估期间零数据外泄。

灵活的 LLM 支持: 该框架被设计为可兼容任何可部署的大语言模型,而不被锁定于某个特定供应商。

沙箱化工具集成: 它利用定制的沙箱环境(包括 Playwright、Docker 和 WebAssembly)来安全地执行测试工具。

监督者与子智能体设计: 该系统采用一个简单的层级结构,由一个 "监督者(Supervisor)" AI 把控全局,并将具体作业分配给"子智能体(Sub-agents)"。这使得复杂任务井然有序,并确保在正确的时间由正确的 AI 做正确的事。

智能决策: AI 并不只是靠猜,而是使用一个"置信度过滤器(Confidence Filter)"。在采取行动之前,它会评估自己对成功的把握有多大。根据评分,它决定是继续推进(绿色)、尝试另一种方式(黄色),还是停下来再次核实事实(红色)。

尽管我们把 Deadend CLI 配置为使用 Gemini,该工具仍持续回退到 OpenAI 供应商。由于 OpenAI 未被配置,执行失败,导致无法针对测试目标有效使用该工具。

9. RedAmon

RedAmon 是一个开源、可自托管的 AI 渗透测试框架,它把侦察、漏洞利用和后渗透串联成一条单一的自主流水线。后渗透是指攻击者攻入之后所做的事,例如获取更多权限或触及同一网络上的其他机器。

它把目标的攻击面绘制到一个图数据库(Neo4j)中,随后在隔离的 Docker 容器内并行运行安全扫描器,并使用 AI 智能体来验证发现。

它还比此列表中大多数工具更进一步。通过其 CypherFix 修复引擎,它可以编写代码修复并直接在目标仓库上提交拉取请求,各自主阶段之间设有人工审批关卡。

Docker 是唯一的宿主前置要求。该框架通过一条 ./redamon.sh install 命令即可安装,大约需要 4 GB 内存和 80 GB 磁盘空间。


关键特性:

攻击面图谱: RedAmon 把目标绘制成一个 Neo4j 知识图谱,让智能体能够基于主机、服务和漏洞之间的关系进行推理,而不是孤立地看待各个发现。

并行化侦察流水线: 该框架以扇出/扇入(fan-out/fan-in)模式协调 40 多款集成的安全工具,包括 GVM/OpenVAS 漏洞扫描,全部在容器内运行,宿主上不安装任何东西。

AI 智能体编排器: 一个基于 LangGraph 的编排器驱动分阶段执行,横跨信息收集、漏洞利用和后渗透各阶段,阶段之间设有人工审批关卡。

CypherFix 修复引擎: 除检测之外,RedAmon 还对每个发现进行分级处理、生成代码修复,并在所连接的仓库上提交拉取请求,把工作流延伸到修复环节。

灵活的 LLM 支持: 它可以通过 Ollama 运行本地模型,或接入 OpenAI、Anthropic、AWS Bedrock 等云端供应商,并可按项目从众多模型中进行选择。

自托管与容器化: 整个技术栈通过 Docker 运行在您自己的基础设施上,使评估数据保持在本地。

RedAmon 攻击链图谱的截图
RedAmon 攻击链图谱

我们针对 vulnbank 的本地托管副本(即 vulnbank.org 背后的开源应用)运行了 RedAmon,而非公开站点。在约 14 分钟的自主侦察后,它的智能体识别出了多个严重漏洞,包括:

  • 确认的 SQL 注入,带有基于错误的数据提取。当首次尝试失败时,该智能体自行纠正了自己的载荷解析。
  • 头像上传功能中的 SSRF(服务器端请求伪造,即诱使服务器去获取攻击者所选择的 URL),被用于触及仅限内部的端点,并泄露了 JWT 签名密钥、Flask 密钥和数据库凭据。
  • 伪造管理员令牌:借助泄露的密钥,该智能体把自己的 JWT(应用用来识别已登录用户的令牌)签名为管理员,并创建了一个新的管理员账户。
  • 使用本地回环地址的其他形式(如 127.1 或十六进制表示法)绕过 SSRF 过滤器。
  • 暴露的 OpenAPI 规范,描述了每一个 API 端点,该智能体利用它构建了自己的漏洞利用链。
  • 注册端点泄露账户内部信息,并在响应中回显凭据。
  • 通过泄露的内部配置,暴露了已启用的调试模式和限速设置。

每个发现都连同其 HTTP 证据和置信度评分一起存储在图谱中,并被关联进一条攻击路径,而非孤立地列出。

本次横评的局限

  • 开源项目变化很快。自 2026 年 10 月 6 日以来,GitHub 指标、特性、文档和部署行为可能已发生变化。
  • 实测结果来自针对单一的故意设置漏洞的应用 vulnbank.org 的测试。它们并不是一项独立的基准测试,在其他目标、LLM 供应商或工具版本下可能有所不同。
  • RedAmon 测试针对的是同一应用的本地托管副本,而非公开的 vulnbank.org 站点,因此其结果未受该公开站点在其他测试期间所出现的可用性问题影响。
  • 部署和执行失败反映的是本文测试时所尝试的配置,在后续版本或其他配置下可能已得到解决。
  • 如上文各节所述,HexStrike AI 和 Nebula 并未作为自主测试工具运行。
  • 在选择某款工具之前,请查阅各项目的仓库和文档以了解其当前能力。

结论

我们对九款开源 AI 渗透测试工具进行了横评,并针对一个银行 Web 应用(vulnbank.org)运行它们,以评估其有效性。

Strix 和 Cybersecurity AI (CAI) 给出了可操作的结果,确认了严重漏洞并产出了概念验证漏洞利用代码,包括 SQL 注入、身份验证绕过和不安全的对象引用。不过请注意,CAI 此后已被归档,不再积极维护。

RedAmon 产出了这组工具中最深入的结果。它的智能体把多个弱点串联成一次攻击:一个 SSRF 泄露了应用的密钥,它随后利用这些密钥伪造管理员令牌并创建了自己的管理员账户。它还确认了 SQL 注入。

PentestGPT、PentAGI、NeuroSploit 和 Deadend CLI 遇到了部署或执行方面的问题,导致它们无法有效完成测试,例如初始化失败、数据库错误或 LLM 供应商配置错误。

HexStrike AI 作为一个 MCP 服务器运作,需要一个兼容的 AI 客户端来编排测试;而 Nebula 则作为一个 AI 辅助的终端工具运作,通过指导和下一步建议来支持人工主导的测试,但并不自主运行。

总体而言,Strix 和 RedAmon 在我们的测试中表现最为出色。RedAmon 是部署最重的一款,大约需要 4 GB 内存和 80 GB 磁盘空间,但它是此处唯一一款走到提交修复拉取请求这一步的工具(通过 CypherFix)。CAI 在我们的测试中同样给出了出色的结果,但此后已被归档,因此新采用者应权衡这一点与那些仍在积极维护的替代方案。其余工具则仍可用于研究、实验或辅助性工作流,具体取决于环境和配置。