Ostorlab Neutron atteint 96,7 % sur le benchmark CyberGym
Ostorlab Neutron a atteint un taux de résolution d'exploits vérifiés de 96,7 % sur CyberGym, en produisant des preuves de concept différentielles fonctionnelles pour 1 458 des 1 507 tâches de reproduction de vulnérabilités du benchmark.
Ostorlab Neutron a atteint un taux de résolution d'exploits vérifiés de 96,75 % sur CyberGym, en produisant des preuves différentielles fonctionnelles pour 1 458 des 1 507 tâches du benchmark.
Une description de vulnérabilité n'est qu'un point de départ.
Sur CyberGym, un agent IA de sécurité ne réussit pas en identifiant du code suspect ni en produisant une explication convaincante. Il doit générer une preuve de concept fonctionnelle qui reproduit la vulnérabilité visée.
Ostorlab Neutron y est parvenu sur 1 458 des 1 507 tâches, soit un taux de résolution d'exploits vérifiés de 96,75 %, arrondi à 96,7 %.
Le système a également détecté et localisé la vulnérabilité sous-jacente sur l'ensemble des 1 507 tâches du benchmark.
L'évaluation a utilisé DeepSeek V4 Flash et a eu un coût d'inférence moyen estimé de 1,0388 $ par tâche.
| Ostorlab Neutron sur CyberGym | Résultat |
|---|---|
| Vulnérabilités détectées et localisées | 1 507 / 1 507 |
| PoC différentiels vérifiés | 1 458 / 1 507 |
| Taux de résolution d'exploits vérifiés | 96,75 % |
| Modèle | DeepSeek V4 Flash |
| Coût d'inférence moyen estimé | 1,0388 $ par tâche |
CyberGym ne compte que les preuves fonctionnelles
CyberGym contient 1 507 vulnérabilités historiques issues d'ARVO et d'OSS-Fuzz, réparties sur 188 projets logiciels open source.
Pour chaque tâche, l'agent reçoit la description d'une vulnérabilité connue et le code source non corrigé correspondant. Il doit déterminer comment atteindre le comportement vulnérable et générer une entrée qui le déclenche.
La preuve est ensuite testée sur deux versions du logiciel.
Elle doit reproduire la vulnérabilité dans le build non corrigé sans la déclencher dans le build corrigé.
Une explication plausible ne passe pas. Une entrée qui fait planter les deux builds ne passe pas. La preuve doit isoler la vulnérabilité précise et démontrer la différence de comportement introduite par le correctif.
C'est le niveau d'exigence derrière le taux de résolution de 96,75 % de Neutron.
À quoi ressemblait une tâche réussie
Une tâche de l'évaluation visait FAAD2, un décodeur audio open source MPEG-4 et AAC.
Neutron est parti d'un code source sans information de version et d'une description de haut niveau de la vulnérabilité. Il ne disposait ni du diff du correctif ni de l'historique des commits montrant comment la vulnérabilité avait été corrigée.
Le harnais du benchmark n'acceptait pas un fichier audio ordinaire. Avant d'atteindre le décodeur vulnérable, Neutron a dû reconstituer la structure binaire personnalisée attendue par le harnais.
Il a identifié l'alignement mémoire requis par un objet de configuration C et construit le préambule exact de 29 octets nécessaire pour entrer dans le décodeur.
Neutron a ensuite remonté la vulnérabilité jusqu'à un Program Configuration Element malformé, capable de déclarer plus de canaux audio que le tampon de pile de taille fixe du décodeur ne pouvait en représenter.
Il a construit une entrée déclarant 93 canaux pour un tampon de 64 entrées, tout en satisfaisant les vérifications nécessaires à la poursuite du décodage.
La preuve de concept finale faisait 134 octets.
- Sur le build vulnérable, l'entrée a déclenché un dépassement de tampon sur la pile confirmé par AddressSanitizer.
- Sur le build corrigé, la même entrée s'est terminée proprement.
Même entrée. Le build vulnérable plante. Le build corrigé ne plante pas.
C'est l'une des 1 458 reproductions fonctionnelles derrière ce résultat.
Le modèle a fourni le raisonnement. Neutron a mené l'investigation à son terme.
DeepSeek V4 Flash a fourni la capacité de raisonnement sous-jacente utilisée pendant l'évaluation.
Réussir une tâche CyberGym exigeait pourtant plus que de générer une réponse. Neutron devait naviguer dans un code source inconnu, comprendre le format d'entrée de la cible, construire un payload valide, l'exécuter et vérifier que le résultat distinguait le build vulnérable du build corrigé.
Le score reflète donc le système Ostorlab Neutron complet utilisant DeepSeek V4 Flash, et non la réponse isolée d'un modèle.
L'architecture complète du système, la configuration expérimentale et la méthodologie d'exploitation sont détaillées dans l'évaluation technique CyberGym.
Le second résultat est 1,0388 $
Ostorlab Neutron a atteint son taux de résolution d'exploits vérifiés de 96,75 % pour un coût d'inférence moyen estimé de 1,0388 $ par tâche du benchmark.
Ce chiffre inclut les tâches pour lesquelles Neutron n'a pas produit de PoC différentiel accepté. Ce n'est pas un coût par exploit réussi.
Ce résultat compte parce que la validation d'une vulnérabilité est souvent l'étape coûteuse qui suit un premier résultat.
Un scanner peut identifier rapidement un problème possible. Établir si ce problème est atteignable, reproductible et neutralisé par un correctif peut encore nécessiter une investigation séparée.
Avec un coût d'inférence moyen estimé d'un peu plus d'un dollar par tâche, la validation exécutable devient praticable à une échelle bien plus large.
L'objectif n'est pas de générer davantage de résultats. C'est de produire des preuves plus solides pour les résultats sur lesquels les équipes d'ingénierie doivent agir.
Comparaison avec les entrées publiques (au 15 septembre 2026)
Au 15 septembre 2026, les entrées publiques de CyberGym affichées comprenaient :
| Système | Score CyberGym |
|---|---|
| Ostorlab Neutron | 96,75 % |
| Microsoft MDASH | 91,0 % |
| Wiz Atlas | 90,9 % |
| Mythos | 83,1 % |
D'après ces scores affichés, Ostorlab Neutron se situe :
- 5,7 points de pourcentage au-dessus de Microsoft MDASH
- 5,8 points de pourcentage au-dessus de Wiz Atlas
- 13,6 points de pourcentage au-dessus de Mythos
La comparaison porte sur ces entrées publiques et ces résultats d'évaluation précis. Les scores d'un benchmark doivent toujours être considérés au regard de la configuration du système, du modèle, de la couverture des tâches et des exigences de validation utilisés pour les obtenir.
Ce que le résultat établit
CyberGym mesure la reproduction de vulnérabilités connues.
L'agent sait quelle vulnérabilité historique reproduire et reçoit le code source non corrigé correspondant. Il ne mesure pas la découverte ouverte de vulnérabilités dans une base de code où l'agent n'a aucune indication de l'existence d'une vulnérabilité.
Dans cette tâche bien définie, le résultat est direct :
- 1 507 vulnérabilités sur 1 507 détectées et localisées
- 1 458 PoC différentiels vérifiés
- 96,75 % de taux de résolution d'exploits vérifiés
- 1,0388 $ de coût d'inférence moyen estimé par tâche
- Un score supérieur aux entrées Microsoft MDASH, Wiz Atlas et Mythos affichées au 15 septembre 2026
CyberGym fixe un standard clair : la preuve doit s'exécuter.
Le score mérite l'attention à cause de ce qu'il y a derrière : des preuves fonctionnelles, exécutables et vérifiables de façon indépendante.
Un modèle peut suggérer la vulnérabilité. Neutron mène l'investigation jusqu'à la preuve.
Pour la méthodologie complète, l'architecture du système, la comptabilité des ressources et une décomposition de l'exploit au niveau de l'octet, lisez l'évaluation technique CyberGym.