9 outils de pentest IA open source comparés (2026)
PentestGPT, PentAGI, HexStrike AI, Strix, CAI, Nebula, NeuroSploit, Deadend CLI et RedAmon comparés : fonctionnalités clés de chaque agent de pentest IA, étoiles GitHub et licences.
Point clé à retenir
Dans notre test pratique contre l'application bancaire vulnbank, Strix et RedAmon ont produit les meilleurs résultats. RedAmon est allé le plus loin, en enchaînant une faille côté serveur jusqu'à un accès administrateur complet à l'application. CAI a lui aussi trouvé des vulnérabilités critiques, mais a depuis été archivé. PentestGPT et Deadend CLI revenaient systématiquement à OpenAI au lieu du modèle que nous avions configuré, l'installation complexe de PentAGI nous a empêchés de le faire fonctionner, et NeuroSploit n'a pas réussi à démarrer. HexStrike AI nécessite un modèle d'IA séparé comme Claude ou GPT pour le piloter, et Nebula assiste un testeur humain plutôt que de tester seul.
Les scanners automatisés sont rapides et fiables pour détecter des problèmes connus. Ce qu'ils ne peuvent pas faire, c'est observer le comportement réel d'une application, enchaîner plusieurs faiblesses en une seule attaque, ou ajuster leur approche en cours de test comme le ferait un humain.
Une nouvelle vague d'outils de pentest IA open source est conçue pour combler cet écart. Ils utilisent de grands modèles de langage pour explorer une application, décider de la prochaine cible et s'adapter au fil de l'eau.
Mais le terme outils de pentest IA recouvre des choses très différentes : certains sont des agents totalement autonomes, l'un est un backend qui ne fonctionne que piloté par un modèle séparé comme Claude ou GPT, et un autre est un assistant pour un testeur humain plutôt qu'un outil autonome.
La documentation seule montre rarement comment ces outils se comportent en pratique ; nous avons donc évalué chacun d'eux en conditions réelles. Nous avons installé les neuf outils et les avons exécutés contre la même application vulnérable, vulnbank.org (RedAmon contre une copie hébergée localement). Pour chaque outil, cet article décrit ce qu'il fait, à quoi ressemble son projet sur GitHub, et les résultats obtenus lors des tests.
À propos de cette comparaison
Cette comparaison est publiée par Ostorlab, qui développe un produit commercial de pentest par IA. Les produits d'Ostorlab ne figurent pas parmi les neuf outils comparés ici. Les descriptions et fonctionnalités clés des outils reposent sur le dépôt GitHub public et la documentation de chaque projet. Les métriques GitHub et les informations sur les projets reflètent les dépôts publics au 6 octobre 2026 ; les valeurs relatives comme « Dernier commit » sont relatives à cette date.
Critères d'évaluation : métriques GitHub (étoiles, commits, contributeurs, dernier commit, licence et stack technique), fonctionnalités clés documentées, et la capacité ou non de chaque outil à être installé et exécuté contre la cible de test, vulnbank.org, ainsi que les résultats qu'il a produits.
Liste des outils de pentest IA open source
- Pentest GPT
- PentAgi
- Hexstrike AI
- Strix
- Cybersecurity AI (CAI)
- Nebula
- Neurosploit
- Deadend CLI
- RedAmon
Comparaison des métriques GitHub
| Outil | Étoiles | Commits | Contributeurs | Dernier commit | Licence | Stack technique |
|---|---|---|---|---|---|---|
| PentestGPT | 15.7k+ | 307+ | 24+ | ~3 mois | MIT | Python (94%), Shell (4%) |
| PentAGI | 25.2k+ | 950+ | 17+ | ~2 jours | MIT | Go (61%), TypeScript (36%) |
| HexStrike AI | 12.4k+ | 63+ | 2+ | ~2 mois | MIT | Python (100%) |
| Strix | 66.7k+ | 900+ | 74+ | < 24 heures | Apache-2.0 | Python (77%), Go (11%), TypeScript (9%) |
| CAI ⚠ (Archivé) |
9.8k+ | 1065+ | 93+ | Archivé (août 2026) | MIT (code du SDK OpenAI) + usage recherche uniquement (code Alias Robotics) | Python (97%) |
| Nebula | 1.1k+ | 1468+ | 7+ | < 24 heures | BSD-2-Clause | Python (61%), TypeScript (32%) |
| NeuroSploit | 1.4k+ | 268+ | 5+ | ~2 jours | MIT | Rust (84%), JavaScript (10%) |
| Deadend CLI | 311+ | 386+ | 5+ | ~2 mois | AGPL-3.0 | Python (77%), Jinja (12%), TypeScript (7%) |
| RedAmon | 2.9k+ | 1343+ | 21+ | < 24 heures | MIT | Python (58%), TypeScript (36%) |
1. PentestGPT
PentestGPT est un framework open source conçu pour automatiser une partie du processus de test d'intrusion à l'aide de grands modèles de langage (LLM).
L'outil utilise trois modules en interaction pour automatiser les chaînes d'attaque tout en gardant une vue d'ensemble de la progression du test :
Module de raisonnement : fait office de stratège en chef. Il maintient un « arbre de tâches » pour gérer la vue d'ensemble et décider de la prochaine étape logique de l'attaque.
Module de génération : fonctionne comme l'exécutant. Il reprend la stratégie du module de raisonnement et crée les commandes terminal ou scripts spécifiques nécessaires pour réaliser la tâche.
Module d'analyse : fait office d'analyste de données. Il nettoie la sortie brute et désordonnée des outils de sécurité, n'en extrayant que les résultats les plus importants à réinjecter dans le système.
Grâce à ce système en trois parties, PentestGPT peut gérer des attaques complexes à plusieurs étapes sans perdre le fil des résultats précédents ni se retrouver bloqué dans des boucles répétitives.
Fonctionnalités clés :
Les fonctionnalités de PentestGPT sont conçues pour automatiser les parties les plus difficiles d'un test d'intrusion :
Moteur de raisonnement automatisé : la plateforme s'appuie sur la logique d'un grand modèle de langage pour résoudre des tâches de test d'intrusion complexes et des défis Capture The Flag (CTF).
Suivi dynamique de session : le système fournit un déroulé en direct qui enregistre et affiche chaque étape du processus de test en temps réel.
Prise en charge de la sécurité multi-domaines : il couvre plusieurs catégories spécialisées, dont la sécurité web, la cryptographie, la rétro-ingénierie, l'investigation numérique et l'exploitation binaire (PWN).
Surveillance de l'activité en direct : les utilisateurs peuvent observer le raisonnement et la progression de l'agent via une boucle de retour continue en temps réel.
Conception modulaire du framework : l'architecture extensible permet l'intégration de nouveaux outils de sécurité et de modules de test personnalisés.
PentestGPT souffre d'une documentation limitée et peu claire. Lors de l'installation, nous avons tenté de l'exécuter via OpenRouter avec un fournisseur spécifique (MoonshotAI), mais l'outil revenait systématiquement au fournisseur OpenAI. Après avoir forcé manuellement le changement de fournisseur vers MoonshotAI, l'outil s'est bloqué pendant l'initialisation et est resté sans réponse pendant une période prolongée, empêchant tout test efficace.
2. PentAGI
PentAGI est un système open source et autonome qui coordonne plusieurs agents IA pour effectuer des tests de sécurité complexes. Il utilise une approche « multi-agents », où des rôles IA spécialisés tels que la recherche, le développement et l'infrastructure travaillent ensemble pour découvrir, analyser et exploiter les vulnérabilités de manière indépendante. L'outil exécute toutes les tâches dans un environnement Docker sécurisé et isolé, en utilisant son propre navigateur et ses propres systèmes de recherche pour recueillir des renseignements en temps réel et adapter sa stratégie d'attaque sans intervention humaine.
Fonctionnalités clés :
Voici les principales fonctionnalités que propose PentAGI :
Agent entièrement autonome : un système piloté par l'IA qui détermine et exécute automatiquement les prochaines étapes d'un test d'intrusion sans aide humaine.
Bac à sable sécurisé : toutes les opérations s'exécutent dans un environnement Docker isolé afin de protéger le système hôte et d'éviter tout dommage accidentel.
Suite de sécurité intégrée : comprend plus de 20 outils professionnels (comme Nmap, Metasploit et Sqlmap) que l'IA peut exécuter et interpréter seule.
Mémoire et recherche intelligentes : utilise un système de mémoire à long terme pour stocker ses recherches et s'intègre à des moteurs de recherche web pour trouver les données CVE les plus récentes.
Équipe de spécialistes : utilise un système de « délégation » où différents agents IA se concentrent sur des tâches spécifiques telles que la recherche, le développement ou l'infrastructure.
Tableau de bord web moderne : propose une interface claire et une journalisation détaillée pour suivre en temps réel la progression et les découvertes de l'IA.
PentAGI a une installation longue et complexe, avec une documentation limitée et des instructions peu claires, ce qui a rendu difficile de faire fonctionner l'outil contre vulnbank.org.
3. HexStrike AI
HexStrike AI est un serveur MCP qui connecte des LLM à plus de 150 outils de sécurité. Il permet à des agents IA de mener leurs propres tests d'intrusion, de trouver des vulnérabilités et d'automatiser des tâches de bug bounty sans intervention manuelle. En résumé, il donne à des modèles comme Claude et GPT une boîte à outils « pratique » pour mener des opérations de sécurité offensive.
Fonctionnalités clés :
HexStrike AI MCP utilise une architecture multi-agents pour gérer les tests autonomes et les données de vulnérabilité.
Connexion des agents : les modèles comme Claude et GPT se connectent via le protocole FastMCP pour exécuter des commandes.
Analyse de cible : le moteur de décision évalue les cibles pour choisir des stratégies et outils de test spécifiques.
Exécution autonome : les agents réalisent des évaluations de sécurité dans différents environnements sans intervention manuelle.
Adaptation du système : la plateforme met à jour sa logique de test en temps réel en fonction des résultats et des vulnérabilités trouvées.
Rapports techniques : le système génère des fiches de vulnérabilité et des données d'analyse de risque pour le résultat final.
HexStrike AI est un serveur MCP, pas un moteur autonome. Il nécessite un client IA externe comme Claude ou GPT pour le piloter ; nous ne l'avons donc pas exécuté contre vulnbank.org en tant que testeur autonome.
4. Strix
Strix est un framework d'agents autonomes conçu pour simuler le comportement d'un attaquant humain en exécutant du code dans des environnements dynamiques. Il identifie des failles de sécurité et confirme leur validité en générant des exploits de preuve de concept fonctionnels. Cette approche fournit aux développeurs et aux équipes de sécurité des résultats vérifiés, réduisant l'effort manuel requis pour le test d'intrusion et le bruit habituellement associé à l'analyse statique.
Fonctionnalités clés :
Sécurité applicative automatisée : Strix utilise une boîte à outils de hacking intégrée pour détecter et valider dynamiquement des vulnérabilités critiques dans votre code. En exécutant les applications en temps réel, il trouve des failles d'exécution que les outils statiques manquent, et les confirme avec des preuves de concept.
Pentest rapide à la demande : en déployant des équipes d'agents collaborant entre eux, le système s'étend à des infrastructures entières pour réaliser des tests d'intrusion en quelques heures au lieu de plusieurs semaines. Cette mise à l'échelle autonome permet aux organisations de générer à la demande des rapports de conformité et des analyses de risque.
Recherche et validation de bug bounty : la plateforme automatise l'ensemble du processus de chasse aux bugs, de la découverte initiale à la génération d'exploits. Elle supprime la charge manuelle de la recherche en trouvant des bugs de façon autonome et en créant les PoC fonctionnels nécessaires pour accélérer le reporting et les récompenses.
Intégration DevSecOps et CI/CD : une CLI pensée pour les développeurs permet une intégration fluide dans les pipelines CI/CD. Cela permet au système de bloquer de façon autonome les vulnérabilités avant qu'elles n'atteignent la production, en fournissant des suggestions de correction automatique et des rapports exploitables directement à l'équipe d'ingénierie.

Nous avons exécuté le framework Strix contre vulnbank.org et identifié plusieurs vulnérabilités critiques, notamment :
- Injection SQL aveugle confirmée sur le endpoint /login, avec confirmation par mesure de temporisation (timing). (CVSS 10.0)
- Infrastructure backend sévèrement dégradée, avec épuisement persistant du pool de connexions à la base de données.
- Système de chat IA opérationnel et exposant des détails du backend API (intégration DeepSeek).
- Plusieurs vulnérabilités documentées inaccessibles en raison de défaillances d'infrastructure.
- Surface d'attaque cartographiée de façon exhaustive, avec plus de 40 endpoints identifiés.
5. Cybersecurity AI (CAI)
⚠ Mise à jour (octobre 2026) : depuis nos tests, CAI a été archivé et sa licence modifiée. Seul le code emprunté au SDK Agents d'OpenAI reste sous MIT ; tout ce qui a été écrit par Alias Robotics, la société derrière CAI, est désormais réservé à un usage de recherche, sans usage commercial ou en production autorisé sans licence commerciale. L'outil s'installe et fonctionne toujours, mais il n'est plus maintenu. Les résultats ci-dessous proviennent de nos tests originaux, lorsqu'il était encore entièrement open source.
CAI est un framework open source pour construire et déployer des agents IA pour des tâches de sécurité offensive et défensive. Il fournit un environnement modulaire permettant aux développeurs et chercheurs d'automatiser la découverte, l'exploitation et la correction des vulnérabilités. Utilisé par diverses organisations, le framework sert d'infrastructure standardisée pour créer des agents de sécurité spécialisés.
Fonctionnalités clés :
Le framework CAI fournit un ensemble modulaire de fonctionnalités conçues pour combler l'écart entre les modèles d'IA et les opérations de sécurité concrètes.
Intégration étendue de modèles : CAI prend nativement en charge plus de 300 modèles, dont OpenAI, Anthropic, DeepSeek, ainsi que des déploiements locaux via Ollama.
Boîte à outils offensive intégrée : le framework comprend des outils préconfigurés pour la reconnaissance, l'exploitation de vulnérabilités et l'élévation de privilèges (obtention d'un contrôle de niveau administrateur non autorisé), afin de rationaliser les workflows de sécurité.
Performance validée : l'architecture est vérifiée à travers des applications pratiques en environnements CTF, programmes de bug bounty et évaluations de sécurité professionnelles.
Architecture d'agents modulaire : le système utilise un framework spécifique aux tâches qui permet aux utilisateurs de construire et déployer des agents spécialisés adaptés à des objectifs de sécurité distincts.
Garde-fous d'exécution : des protocoles de sécurité intégrés protègent l'environnement contre l'injection de prompt et l'exécution de commandes non autorisées ou dangereuses.
Orientation recherche communautaire : conçu comme une plateforme axée recherche en premier lieu, le framework vise à standardiser et à rendre accessibles les outils de cybersécurité pilotés par l'IA pour une communauté plus large.

Nous avons exécuté le framework CAI contre vulnbank.org et identifié plusieurs vulnérabilités de sévérité élevée et critique, notamment :
-
Injection SQL permettant un contournement d'authentification et une prise de contrôle complète de compte
-
Débogueur Werkzeug exposé, permettant potentiellement une exécution de code à distance
-
Références directes non sécurisées à des objets (IDOR), permettant un accès aux données d'autres comptes
-
Fonctionnalité de virement d'argent non restreinte, permettant des transferts de fonds non autorisés
-
Création de comptes illimitée, permettant fraude et abus à grande échelle
-
Messages d'erreur verbeux révélant la logique interne de l'application
-
Problèmes d'injection de token JWT menant à des abus de session et de privilèges
6. Nebula
Nebula est un assistant de test d'intrusion open source qui intègre directement de grands modèles de langage à l'interface en ligne de commande. Il automatise des tâches techniques comme la reconnaissance, l'analyse de vulnérabilités et la documentation des sessions. En interprétant les sorties du terminal en temps réel, l'outil propose des suggestions pour la suite des tests et tient un journal automatisé des découvertes et de l'historique des commandes.
Fonctionnalités clés :
Nebula offre une suite complète de fonctionnalités enrichies par l'IA pour automatiser les phases de collecte de données et de documentation d'une mission de sécurité.
Recherche internet agentique : l'outil utilise des agents IA pour puiser en temps réel du contexte et des actualités de cybersécurité sur le web, afin de tenir les utilisateurs informés des dernières tendances, comme le malware cloud émergent VoidLink ou le zero-day Gogs RCE récemment divulgué.
Prise de notes automatisée : Nebula gère l'enregistrement et la catégorisation des découvertes techniques, en les associant à des standards de sécurité comme CWE et NIST, sans intervention manuelle.
Analyses contextuelles : le système analyse en direct les sorties des outils de sécurité dans le terminal et fournit des suggestions immédiates pour les prochaines étapes, comme des techniques spécifiques de découverte ou d'exploitation de vulnérabilités.
Intégration d'outils multi-sources : les utilisateurs peuvent importer des données depuis des utilitaires externes de reconnaissance et de scan afin de centraliser l'analyse et générer des recommandations de remédiation pilotées par l'IA.
Capture de preuves intégrée : la plateforme inclut des outils pour prendre des captures d'écran et ajouter des notes ou surlignages rapides directement depuis votre écran de commande. Cela permet de rassembler beaucoup plus rapidement les preuves nécessaires pour votre rapport final.
Journalisation des actions : le système maintient une piste d'audit complète en enregistrant automatiquement chaque commande exécutée, aux côtés des notes techniques manuelles, pour un historique de session complet.
Flux d'activité en direct : un panneau de statut en temps réel surveille les activités en cours et la progression de la mission, se rafraîchissant toutes les cinq minutes pour garder les phases de test sur la bonne voie.
Nebula est un assistant de terminal IA interactif, et non un outil de test d'intrusion autonome ; il ne peut donc pas être exécuté de façon totalement autonome contre une cible. Il sert à assister des tests menés par un humain, en aidant sur les commandes, les payloads et l'analyse, plutôt qu'en produisant des résultats de façon autonome.
7. NeuroSploit
NeuroSploit est un écosystème de test d'intrusion piloté par l'IA, conçu pour automatiser et renforcer plusieurs aspects des tâches de sécurité offensive. En exploitant la puissance des grands modèles de langage (LLM), le framework propose des personas d'agents dédiés, capables d'analyse de cible, de détection de vulnérabilités, de planification d'exploitation et de support défensif, le tout maintenu dans un souci de sécurité opérationnelle et de normes éthiques.
Fonctionnalités clés :
NeuroSploit est un « assistant » intelligent pour le hacking. Il utilise un « cerveau » IA (LLM) pour aider les experts en sécurité à automatiser les parties fastidieuses de leur travail. Plutôt que d'exécuter un seul scan à la fois, il utilise des agents IA spécialisés pour planifier des attaques, trouver des points faibles et tester les défenses bien plus vite qu'un humain ne pourrait le faire manuellement.
Écosystème d'agents spécialisés : le framework utilise un système basé sur des rôles pour déployer des agents adaptés à des opérations spécifiques, comme le Red Teaming pour la simulation d'attaque, le Blue Teaming pour les audits défensifs, ou l'analyse de malware pour l'inspection des menaces.
Exécution multi-modèles et locale : il s'intègre à un large éventail de fournisseurs de LLM, dont Gemini, Claude et GPT, et offre un support natif pour LM Studio et Ollama afin de permettre une exécution entièrement locale et privée.
Orchestration automatisée d'outils : le système peut enchaîner des outils de sécurité externes comme Nmap, Metasploit et Nuclei, permettant aux agents IA de gérer de façon autonome des workflows complexes de reconnaissance et d'exploitation.
Validation des vulnérabilités et renseignement : au-delà du simple scan, la plateforme inclut des collecteurs OSINT et des outils d'énumération DNS intégrés pour recueillir du renseignement sur la cible et effectuer des tests de mouvement latéral et de persistance.
Rapports fiables et garde-fous : pour garantir des résultats professionnels, le framework génère des rapports structurés HTML et JSON tout en utilisant des techniques d'ancrage et d'auto-réflexion pour minimiser les hallucinations de l'IA et les faux positifs.
NeuroSploit n'a pas réussi à démarrer correctement en raison de problèmes lors de l'initialisation, ce qui l'a empêché d'exécuter des tests ou de produire des résultats exploitables.
8. Deadend CLI
Deadend CLI est un agent autonome de test d'intrusion qui utilise l'auto-correction pour surmonter les blocages de sécurité. Lorsqu'une attaque classique échoue, l'agent lit la réponse d'erreur pour comprendre la défense spécifique en place, puis écrit du code Python sur mesure pour la contourner. Ce cycle continu d'action et d'apprentissage permet à l'outil de faire évoluer ses tactiques en temps réel jusqu'à percer la cible avec succès.
Fonctionnalités clés :
Deadend CLI utilise un ensemble spécifique de fonctionnalités architecturales pour permettre un test d'intrusion web local et autonome.
Exécution locale : le système s'exécute entièrement sur l'infrastructure locale, sans dépendance cloud, garantissant une absence totale d'exfiltration de données pendant les évaluations de sécurité.
Support LLM flexible : le framework est conçu pour être compatible avec n'importe quel grand modèle de langage déployable, plutôt que d'être verrouillé sur un fournisseur spécifique.
Intégration d'outils en bac à sable : il utilise des environnements en bac à sable personnalisés, dont Playwright, Docker et WebAssembly, pour exécuter les outils de test de façon sécurisée.
Conception superviseur/sous-agents : le système utilise une hiérarchie simple où une IA « Superviseur » gère la vue d'ensemble et assigne des tâches spécifiques à des « Sous-agents ». Cela permet de garder les tâches complexes organisées et de s'assurer que la bonne IA fait le bon travail au bon moment.
Prise de décision intelligente : au lieu de simplement deviner, l'IA utilise un « filtre de confiance ». Avant d'agir, elle évalue son degré de certitude quant au succès. Selon le score, elle décide d'avancer (vert), d'essayer une approche différente (jaune), ou de s'arrêter pour revérifier ses hypothèses (rouge).
Bien que Deadend CLI ait été configuré pour utiliser Gemini, l'outil continuait de revenir par défaut au fournisseur OpenAI. OpenAI n'étant pas configuré, l'exécution a échoué, empêchant toute utilisation efficace de l'outil contre les cibles de test.
9. RedAmon
RedAmon est un framework de pentest par IA open source et auto-hébergé qui enchaîne reconnaissance, exploitation et post-exploitation dans un seul pipeline autonome. La post-exploitation désigne ce qu'un attaquant fait après une intrusion, comme obtenir davantage de privilèges ou atteindre d'autres machines sur le même réseau.
Il cartographie la surface d'attaque d'une cible dans une base de données orientée graphe (Neo4j), puis exécute des scanners de sécurité en parallèle dans des conteneurs Docker isolés, et utilise des agents IA pour valider les découvertes.
Il va également plus loin que la plupart des outils de cette liste. Grâce à son moteur de remédiation CypherFix, il peut écrire des correctifs de code et ouvrir des pull requests directement sur le dépôt de la cible, avec des points de validation humaine entre les phases autonomes.
Docker est le seul prérequis sur l'hôte. Le framework s'installe avec une seule commande ./redamon.sh install et nécessite environ 4 Go de RAM et 80 Go de disque.
Fonctionnalités clés :
Graphe de surface d'attaque : RedAmon cartographie la cible dans un graphe de connaissances Neo4j afin que l'agent puisse raisonner sur les relations entre hôtes, services et vulnérabilités plutôt que de traiter les découvertes de façon isolée.
Pipeline de reconnaissance parallélisé : le framework coordonne plus de 40 outils de sécurité intégrés selon un schéma de distribution/agrégation (fan-out/fan-in), y compris le scan de vulnérabilités GVM/OpenVAS, le tout dans des conteneurs afin que rien ne soit installé sur l'hôte.
Orchestrateur d'agents IA : un orchestrateur basé sur LangGraph pilote une exécution par phases couvrant les étapes informationnelles, d'exploitation et de post-exploitation, avec des points de validation humaine entre les phases.
Moteur de remédiation CypherFix : au-delà de la détection, RedAmon trie chaque découverte, génère un correctif de code et ouvre une pull request sur le dépôt connecté, étendant ainsi le workflow jusqu'à la remédiation.
Support LLM flexible : il fonctionne avec des modèles locaux via Ollama ou des fournisseurs cloud comme OpenAI, Anthropic et AWS Bedrock, avec un large choix de modèles sélectionnables par projet.
Auto-hébergé et conteneurisé : l'ensemble de la pile tourne sur votre propre infrastructure via Docker, gardant les données d'évaluation en local.

Nous avons exécuté RedAmon contre une copie hébergée localement de vulnbank, l'application open source derrière vulnbank.org, plutôt que contre le site public. Après une passe de reconnaissance autonome d'environ 14 minutes, son agent a identifié plusieurs vulnérabilités critiques, notamment :
- Injection SQL confirmée avec extraction de données par messages d'erreur. L'agent a corrigé lui-même l'analyse de son payload lorsque sa première tentative a échoué.
- SSRF (server-side request forgery, le fait d'inciter le serveur à récupérer une URL choisie par l'attaquant) dans le téléversement de photo de profil, utilisé pour atteindre des endpoints internes uniquement et divulguer le secret de signature JWT, la clé secrète Flask et les identifiants de base de données.
- Token admin forgé : avec le secret divulgué, l'agent a signé son propre JWT (le jeton que l'application utilise pour identifier les utilisateurs connectés) en tant qu'administrateur et créé un nouveau compte admin.
- Contournement du filtre SSRF à l'aide de formes alternatives de l'adresse localhost, telles que
127.1ou la notation hexadécimale. - Spécification OpenAPI exposée, décrivant chaque endpoint de l'API, que l'agent a utilisée pour construire sa chaîne d'exploitation.
- Endpoint d'inscription divulguant des informations internes sur les comptes et renvoyant les identifiants dans la réponse.
- Mode débogage activé et paramètres de limitation de débit divulgués via la configuration interne exposée.
Chaque découverte est stockée dans le graphe avec ses preuves HTTP et un score de confiance, reliée dans un chemin d'attaque plutôt que listée isolément.
Limites de cette comparaison
- Les projets open source évoluent rapidement. Les métriques GitHub, les fonctionnalités, la documentation et le comportement d'installation peuvent avoir changé depuis le 6 octobre 2026.
- Les résultats pratiques proviennent de tests contre une seule application volontairement vulnérable, vulnbank.org. Ils ne constituent pas un benchmark indépendant et peuvent différer avec d'autres cibles, fournisseurs de LLM ou versions des outils.
- RedAmon a été testé contre une copie hébergée localement de la même application plutôt que contre le site public vulnbank.org ; ses résultats n'ont donc pas été affectés par les problèmes de disponibilité rencontrés par le site public lors d'autres tests.
- Les échecs d'installation et d'exécution reflètent la configuration tentée pour cet article au moment des tests, et peuvent être résolus dans des versions ultérieures ou avec d'autres configurations.
- HexStrike AI et Nebula n'ont pas été exécutés en tant que testeurs autonomes, comme indiqué dans leurs sections respectives ci-dessus.
- Consultez le dépôt et la documentation de chaque projet pour connaître ses capacités actuelles avant de choisir un outil.
Conclusion
Nous avons comparé neuf outils de pentest IA open source et les avons exécutés contre une application web bancaire (vulnbank.org) pour évaluer leur efficacité.
Strix et Cybersecurity AI (CAI) ont produit des résultats exploitables, confirmant des vulnérabilités critiques et générant des exploits de preuve de concept, notamment injection SQL, contournement d'authentification et références d'objets non sécurisées. Notez toutefois que CAI a depuis été archivé et n'est plus activement maintenu.
RedAmon a produit les résultats les plus poussés de l'ensemble. Son agent a enchaîné plusieurs faiblesses en une seule attaque : un SSRF a divulgué les secrets de l'application, qu'il a ensuite utilisés pour forger un token admin et créer son propre compte administrateur. Il a également confirmé une injection SQL.
PentestGPT, PentAGI, NeuroSploit et Deadend CLI ont rencontré des problèmes d'installation ou d'exécution qui les ont empêchés de mener leurs tests à bien, tels que des échecs d'initialisation, des erreurs de base de données ou des erreurs de configuration de fournisseur LLM.
HexStrike AI fonctionne comme un serveur MCP, nécessitant un client IA compatible pour orchestrer les tests, tandis que Nebula fonctionne comme un outil de terminal assisté par IA qui accompagne des tests menés par un humain avec des conseils et des suggestions d'étapes suivantes, mais sans s'exécuter de façon autonome.
Dans l'ensemble, Strix et RedAmon ont produit les meilleurs résultats de notre test. RedAmon est le plus lourd à déployer, nécessitant environ 4 Go de RAM et 80 Go de disque, mais c'est le seul outil de cette liste qui va jusqu'à ouvrir une pull request de correction, via CypherFix. CAI a lui aussi produit de bons résultats lors de nos tests, mais a depuis été archivé ; les nouveaux adoptants devraient donc mettre cela en balance avec des alternatives activement maintenues. Les autres outils restent utiles pour la recherche, l'expérimentation ou des workflows assistés, selon l'environnement et la configuration.