Neutron, notre moteur d’IA, a obtenu un score de 96,75 % sur le benchmark CyberGym de l’UC Berkeley. En savoir plus

Sécurité

Sécurité

Ostorlab Neutron atteint 96,7 % sur le benchmark CyberGym

Ostorlab Neutron a atteint un taux de résolution d'exploits vérifiés de 96,7 % sur CyberGym, en produisant des preuves de concept différentielles fonctionnelles pour 1 458 des 1 507 tâches de reproduction de vulnérabilités du benchmark.

Ostorlab Neutron a atteint un taux de résolution d'exploits vérifiés de 96,75 % sur CyberGym, en produisant des preuves différentielles fonctionnelles pour 1 458 des 1 507 tâches du benchmark.

Une description de vulnérabilité n'est qu'un point de départ.

Sur CyberGym, un agent IA de sécurité ne réussit pas en identifiant du code suspect ni en produisant une explication convaincante. Il doit générer une preuve de concept fonctionnelle qui reproduit la vulnérabilité visée.

Ostorlab Neutron y est parvenu sur 1 458 des 1 507 tâches, soit un taux de résolution d'exploits vérifiés de 96,75 %, arrondi à 96,7 %.

Le système a également détecté et localisé la vulnérabilité sous-jacente sur l'ensemble des 1 507 tâches du benchmark.

L'évaluation a utilisé DeepSeek V4 Flash et a eu un coût d'inférence moyen estimé de 1,0388 $ par tâche.

Ostorlab Neutron sur CyberGym Résultat
Vulnérabilités détectées et localisées 1 507 / 1 507
PoC différentiels vérifiés 1 458 / 1 507
Taux de résolution d'exploits vérifiés 96,75 %
Modèle DeepSeek V4 Flash
Coût d'inférence moyen estimé 1,0388 $ par tâche

CyberGym ne compte que les preuves fonctionnelles

CyberGym contient 1 507 vulnérabilités historiques issues d'ARVO et d'OSS-Fuzz, réparties sur 188 projets logiciels open source.

Pour chaque tâche, l'agent reçoit la description d'une vulnérabilité connue et le code source non corrigé correspondant. Il doit déterminer comment atteindre le comportement vulnérable et générer une entrée qui le déclenche.

La preuve est ensuite testée sur deux versions du logiciel.

Elle doit reproduire la vulnérabilité dans le build non corrigé sans la déclencher dans le build corrigé.

Une explication plausible ne passe pas. Une entrée qui fait planter les deux builds ne passe pas. La preuve doit isoler la vulnérabilité précise et démontrer la différence de comportement introduite par le correctif.

C'est le niveau d'exigence derrière le taux de résolution de 96,75 % de Neutron.

À quoi ressemblait une tâche réussie

Une tâche de l'évaluation visait FAAD2, un décodeur audio open source MPEG-4 et AAC.

Neutron est parti d'un code source sans information de version et d'une description de haut niveau de la vulnérabilité. Il ne disposait ni du diff du correctif ni de l'historique des commits montrant comment la vulnérabilité avait été corrigée.

Le harnais du benchmark n'acceptait pas un fichier audio ordinaire. Avant d'atteindre le décodeur vulnérable, Neutron a dû reconstituer la structure binaire personnalisée attendue par le harnais.

Il a identifié l'alignement mémoire requis par un objet de configuration C et construit le préambule exact de 29 octets nécessaire pour entrer dans le décodeur.

Neutron a ensuite remonté la vulnérabilité jusqu'à un Program Configuration Element malformé, capable de déclarer plus de canaux audio que le tampon de pile de taille fixe du décodeur ne pouvait en représenter.

Il a construit une entrée déclarant 93 canaux pour un tampon de 64 entrées, tout en satisfaisant les vérifications nécessaires à la poursuite du décodage.

La preuve de concept finale faisait 134 octets.

  • Sur le build vulnérable, l'entrée a déclenché un dépassement de tampon sur la pile confirmé par AddressSanitizer.
  • Sur le build corrigé, la même entrée s'est terminée proprement.

Même entrée. Le build vulnérable plante. Le build corrigé ne plante pas.

C'est l'une des 1 458 reproductions fonctionnelles derrière ce résultat.

Le modèle a fourni le raisonnement. Neutron a mené l'investigation à son terme.

DeepSeek V4 Flash a fourni la capacité de raisonnement sous-jacente utilisée pendant l'évaluation.

Réussir une tâche CyberGym exigeait pourtant plus que de générer une réponse. Neutron devait naviguer dans un code source inconnu, comprendre le format d'entrée de la cible, construire un payload valide, l'exécuter et vérifier que le résultat distinguait le build vulnérable du build corrigé.

Le score reflète donc le système Ostorlab Neutron complet utilisant DeepSeek V4 Flash, et non la réponse isolée d'un modèle.

L'architecture complète du système, la configuration expérimentale et la méthodologie d'exploitation sont détaillées dans l'évaluation technique CyberGym.

Le second résultat est 1,0388 $

Ostorlab Neutron a atteint son taux de résolution d'exploits vérifiés de 96,75 % pour un coût d'inférence moyen estimé de 1,0388 $ par tâche du benchmark.

Ce chiffre inclut les tâches pour lesquelles Neutron n'a pas produit de PoC différentiel accepté. Ce n'est pas un coût par exploit réussi.

Ce résultat compte parce que la validation d'une vulnérabilité est souvent l'étape coûteuse qui suit un premier résultat.

Un scanner peut identifier rapidement un problème possible. Établir si ce problème est atteignable, reproductible et neutralisé par un correctif peut encore nécessiter une investigation séparée.

Avec un coût d'inférence moyen estimé d'un peu plus d'un dollar par tâche, la validation exécutable devient praticable à une échelle bien plus large.

L'objectif n'est pas de générer davantage de résultats. C'est de produire des preuves plus solides pour les résultats sur lesquels les équipes d'ingénierie doivent agir.

Comparaison avec les entrées publiques (au 15 septembre 2026)

Au 15 septembre 2026, les entrées publiques de CyberGym affichées comprenaient :

Système Score CyberGym
Ostorlab Neutron 96,75 %
Microsoft MDASH 91,0 %
Wiz Atlas 90,9 %
Mythos 83,1 %

D'après ces scores affichés, Ostorlab Neutron se situe :

  • 5,7 points de pourcentage au-dessus de Microsoft MDASH
  • 5,8 points de pourcentage au-dessus de Wiz Atlas
  • 13,6 points de pourcentage au-dessus de Mythos

La comparaison porte sur ces entrées publiques et ces résultats d'évaluation précis. Les scores d'un benchmark doivent toujours être considérés au regard de la configuration du système, du modèle, de la couverture des tâches et des exigences de validation utilisés pour les obtenir.

Ce que le résultat établit

CyberGym mesure la reproduction de vulnérabilités connues.

L'agent sait quelle vulnérabilité historique reproduire et reçoit le code source non corrigé correspondant. Il ne mesure pas la découverte ouverte de vulnérabilités dans une base de code où l'agent n'a aucune indication de l'existence d'une vulnérabilité.

Dans cette tâche bien définie, le résultat est direct :

  • 1 507 vulnérabilités sur 1 507 détectées et localisées
  • 1 458 PoC différentiels vérifiés
  • 96,75 % de taux de résolution d'exploits vérifiés
  • 1,0388 $ de coût d'inférence moyen estimé par tâche
  • Un score supérieur aux entrées Microsoft MDASH, Wiz Atlas et Mythos affichées au 15 septembre 2026

CyberGym fixe un standard clair : la preuve doit s'exécuter.

Le score mérite l'attention à cause de ce qu'il y a derrière : des preuves fonctionnelles, exécutables et vérifiables de façon indépendante.

Un modèle peut suggérer la vulnérabilité. Neutron mène l'investigation jusqu'à la preuve.

Pour la méthodologie complète, l'architecture du système, la comptabilité des ressources et une décomposition de l'exploit au niveau de l'octet, lisez l'évaluation technique CyberGym.