Ostorlab Neutron alcanza el 96.7% en el benchmark CyberGym
Ostorlab Neutron alcanzó una tasa de resolución de exploits verificados del 96.7% en CyberGym, y generó pruebas de concepto diferenciales funcionales para 1,458 de las 1,507 tareas de reproducción de vulnerabilidades del benchmark.
Ostorlab Neutron logró una tasa de resolución de exploits verificados del 96.75% en CyberGym, con pruebas diferenciales funcionales para 1,458 de las 1,507 tareas del benchmark.
La descripción de una vulnerabilidad es solo el punto de partida.
En CyberGym, un agente de seguridad de IA no supera una tarea por identificar código sospechoso ni por ofrecer una explicación convincente. Debe generar una prueba de concepto funcional que reproduzca la vulnerabilidad objetivo.
Ostorlab Neutron lo logró en 1,458 de 1,507 tareas, lo que supone una tasa de resolución de exploits verificados del 96.75%, redondeada a 96.7%.
El sistema también detectó y localizó la vulnerabilidad subyacente en las 1,507 tareas del benchmark.
La evaluación utilizó DeepSeek V4 Flash y tuvo un coste medio estimado de inferencia de 1.0388 $ por tarea.
| Ostorlab Neutron en CyberGym | Resultado |
|---|---|
| Vulnerabilidades detectadas y localizadas | 1,507 / 1,507 |
| PoC diferenciales verificadas | 1,458 / 1,507 |
| Tasa de resolución de exploits verificados | 96.75% |
| Modelo | DeepSeek V4 Flash |
| Coste medio estimado de inferencia | 1.0388 $ por tarea |
CyberGym cuenta las pruebas que funcionan
CyberGym contiene 1,507 vulnerabilidades históricas de ARVO y OSS-Fuzz, repartidas en 188 proyectos de software de código abierto.
En cada tarea, el agente recibe la descripción de una vulnerabilidad conocida y el código fuente correspondiente sin parchear. Debe determinar cómo se puede alcanzar el comportamiento vulnerable y generar una entrada que lo desencadene.
A continuación, la prueba se somete a dos versiones del software.
Debe reproducir la vulnerabilidad en la compilación sin parchear sin activarla en la compilación parcheada.
Una explicación plausible no basta. Una entrada que bloquea ambas compilaciones tampoco. La prueba debe aislar la vulnerabilidad concreta y demostrar la diferencia de comportamiento introducida por el parche.
Ese es el estándar que respalda la tasa de resolución del 96.75% de Neutron.
Cómo fue una tarea resuelta con éxito
Una de las tareas de la evaluación tenía como objetivo FAAD2, un decodificador de audio MPEG-4 y AAC de código abierto.
Neutron partió de un código fuente sin versión y de una descripción de alto nivel de la vulnerabilidad. No disponía de ninguna diferencia de parche ni de un historial de commits que mostrara cómo se había corregido la vulnerabilidad.
El harness del benchmark no aceptaba un archivo de audio ordinario. Antes de llegar al decodificador vulnerable, Neutron tuvo que reconstruir la estructura binaria personalizada que esperaba el harness.
Identificó la alineación de memoria que requería un objeto de configuración en C y construyó el preámbulo de 29 bytes exacto necesario para entrar en el decodificador.
Después, Neutron rastreó la vulnerabilidad hasta un Program Configuration Element malformado que podía declarar más canales de audio de los que el búfer de pila de tamaño fijo del decodificador podía representar.
Construyó una entrada que declaraba 93 canales frente a un búfer de 64 entradas, cumpliendo al mismo tiempo las comprobaciones necesarias para que la decodificación continuara.
La prueba de concepto final ocupaba 134 bytes.
- En la compilación vulnerable, la entrada desencadenó un desbordamiento de búfer de pila confirmado por AddressSanitizer.
- En la compilación parcheada, la misma entrada terminó limpiamente.
La misma entrada. La compilación vulnerable se bloquea. La parcheada, no.
Esa es una de las 1,458 reproducciones funcionales que respaldan el resultado.
El modelo aportó el razonamiento. Neutron completó la investigación.
DeepSeek V4 Flash proporcionó la capacidad de razonamiento subyacente utilizada durante la evaluación.
Completar una tarea de CyberGym exigía algo más que generar una respuesta. Neutron tuvo que navegar por código fuente desconocido, comprender el formato de entrada del objetivo, construir un payload válido, ejecutarlo y verificar que el resultado distinguía la compilación vulnerable de la parcheada.
Por tanto, la puntuación refleja el sistema completo de Ostorlab Neutron con DeepSeek V4 Flash, no una respuesta aislada de un modelo.
La arquitectura completa del sistema, la configuración experimental y la metodología de explotación se describen en la evaluación técnica de CyberGym.
El segundo resultado es 1.0388 $
Ostorlab Neutron alcanzó su tasa de resolución de exploits verificados del 96.75% con un coste medio estimado de inferencia de 1.0388 $ por tarea del benchmark.
Esa cifra incluye las tareas para las que Neutron no produjo una PoC diferencial aceptada. No es un coste por exploit exitoso.
El resultado importa porque la validación de vulnerabilidades suele ser el paso costoso que sigue a un hallazgo inicial.
Un escáner puede identificar rápidamente un posible problema. Determinar si el problema es alcanzable, reproducible y queda neutralizado por un parche puede seguir exigiendo una investigación aparte.
Con un coste medio estimado de inferencia de poco más de un dólar por tarea, la validación ejecutable se vuelve viable a una escala mucho más amplia.
El objetivo no es generar más hallazgos. Es producir evidencias más sólidas para los hallazgos sobre los que se espera que actúen los equipos de ingeniería.
Cómo se compara el resultado con las entradas públicas (a 15 de septiembre de 2026)
A 15 de septiembre de 2026, las entradas públicas de CyberGym que se mostraban incluían:
| Sistema | Puntuación en CyberGym |
|---|---|
| Ostorlab Neutron | 96.75% |
| Microsoft MDASH | 91.0% |
| Wiz Atlas | 90.9% |
| Mythos | 83.1% |
Según esas puntuaciones mostradas, Ostorlab Neutron se sitúa:
- 5.7 puntos porcentuales por encima de Microsoft MDASH
- 5.8 puntos porcentuales por encima de Wiz Atlas
- 13.6 puntos porcentuales por encima de Mythos
La comparación se refiere a esas entradas públicas y resultados de evaluación concretos. Las puntuaciones de un benchmark deben considerarse siempre junto con la configuración del sistema, el modelo, la cobertura de tareas y los requisitos de validación utilizados para obtenerlas.
Qué establece el resultado
CyberGym mide la reproducción de vulnerabilidades conocidas.
Al agente se le indica qué vulnerabilidad histórica debe reproducir y recibe el código fuente correspondiente sin parchear. No mide el descubrimiento abierto de vulnerabilidades en una base de código en la que el agente no tiene ningún indicio de que exista una vulnerabilidad.
Dentro de esa tarea definida, el resultado es directo:
- 1,507 de 1,507 vulnerabilidades detectadas y localizadas
- 1,458 PoC diferenciales verificadas
- Tasa de resolución de exploits verificados del 96.75%
- Coste medio estimado de inferencia de 1.0388 $ por tarea
- Una puntuación superior a las entradas de Microsoft MDASH, Wiz Atlas y Mythos mostradas a 15 de septiembre de 2026
CyberGym fija un estándar claro: la prueba tiene que ejecutarse.
La puntuación merece atención por lo que hay detrás: evidencias funcionales que pueden ejecutarse y comprobarse de forma independiente.
Un modelo puede sugerir la vulnerabilidad. Neutron lleva la investigación hasta la prueba.
Para conocer la metodología completa, la arquitectura del sistema, la contabilidad de recursos y un desglose del exploit a nivel de byte, lea la evaluación técnica de CyberGym.