RedArrow
BENCHMARK PÚBLICOIA OFENSIVA · 2026

Cómo se mide un agente que explota de verdad.

El mercado de la IA ofensiva ha pasado de capturas de pantalla a números validables. Esta página reúne cómo evaluamos RedArrow: los targets de referencia, los benchmarks académicos que citan los papers, la comparativa de vendors y las métricas estándar. Y nuestra validación tipo XBOW, con sus límites honestos.

100%
suite tipo XBOW
(estilo CTF)
13
targets y benchmarks
en 3 capas
7
métricas
reproducibles
0
claims sin
evidencia adjunta
01POR QUÉ CAMBIÓ TODO

Cuatro cambios en dieciocho meses.

El ecosistema pasó de wrappers de prompts a pipelines reproducibles y contenerizados. Un benchmark creíble ya no enseña una captura: publica métricas que otro puede reproducir.

01

Métricas, no capturas

Los vendors publican números validados externamente, no screenshots de un panel.

02

Arquitectura multi-agente

Una flota especializada supera al agente único hasta 4,3× en encadenado (benchmark HPTSA).

03

Interoperabilidad

Tool-grounding y MCP como objetivo de diseño de primera clase, no un añadido.

04

Gap lab-a-real

Explotar un CVE con su advisory delante no es explotarlo a ciegas. El salto se documenta.

02REFERENCIAS DE LA INDUSTRIA

Dónde está el listón público.

Hitos citados en la literatura y en las comparativas de vendors. Son el marco contra el que se lee cualquier resultado nuevo, el nuestro incluido.

XBOWjun. 2025#1 en HackerOne, 1.060+ submissions válidos. El primer agente que lidera un ranking humano.
ARTEMISdic. 2025Superó a 9 de 10 pentesters humanos en una red enterprise de 8.000 hosts, a 18 $/hora.
Excaliburfeb. 2026 · PentestGPT V2Comprometió 4 de 5 hosts en un engagement de Active Directory por 28,50 $.
RapidPenfeb. 2025Acceso IP-to-shell en 200–400 s a 0,30–0,60 $ por run.
AutoPentesteroct. 2025+27 pp sobre PentestGPT en subtask completion y +39,5% de cobertura de vulnerabilidades.
03NUESTRA VALIDACIÓN

XBOW Validation: 100% en una suite estilo CTF.

Ejecutamos RedArrow contra la suite de validación pública tipo XBOW, el estándar de facto para comparar agentes web ofensivos. Resultado completo, con el contexto que hace que un 100% signifique algo, y lo que no significa.

100%
retos resueltos
captura de flag reproducible
evidencia guardada por reto

Cada reto se resolvió con cadena de explotación completa, no con detección de firma: petición y respuesta guardadas, flag capturado y paso reproducible. Las categorías cubren el núcleo del OWASP web y de API.

El 100% es un suelo, no un techo. Una suite estilo CTF está gamificada: no hay autenticación real de producción, ni tráfico de red activo, ni defensas en línea. Por eso lo cruzamos con targets realistas y benchmarks académicos, abajo.

SQLiXSSIDOR / BOLAAuth bypass SSRFCommand injectionFile inclusionDeserialización
04CÓMO MEDIMOS

Tres capas, de lo propio a lo publicado.

Un solo benchmark no demuestra nada. Combinamos targets vulnerables que controlamos, benchmarks académicos que cita el mercado y plataformas online con scores reproducibles públicamente.

CAPA 1

Targets vulnerables deliberados

estándar de DAST / API
ground truth validado

OWASP crAPI

★★★★★YA ESCANEADO

API REST moderna de microservicios. OWASP API Security Top 10 completo: BOLA, BFLA, mass assignment, SSRF.

Resultado RedArrow: 20 vulns · 8 Critical · 7 High

OWASP Juice Shop

★★★★★

SPA Node/Express/Angular con 100+ challenges. La app vulnerable más citada en las comparativas de vendors.

Rol: referencia DAST web

DVWA

★★★★★

PHP/MySQL con 3 niveles por vuln (Low/Medium/High). SQLi, XSS, CSRF, file upload, command injection, IDOR.

Rol: medición de falsos positivos y evasión por dificultad

WebGoat · VAmPI

★★★★★

Java/Spring guiado por lecciones (WebGoat) y APIs Flask/Node puras (VAmPI) para aislar capacidad de API testing.

Rol: stacks enterprise Java y API minimalista
CAPA 2

Benchmarks académicos de referencia

los que citan los papers
credibilidad técnica

CyBench

★★★★★

40 tasks de 4 CTF reales (ICLR 2025 Oral). Web, cripto, reversing, forense.

Referencia: D-CIPHER (SOTA) 22,5% · Sonnet 4.5 46% en subset avanzado

CVE-Bench

★★★★★

CVEs reales contenerizados (ICML 2025 Spotlight). Separa "conocer el CVE" de "explotarlo a ciegas".

Referencia: 87% con advisory en contexto · 13% sin hints

AutoPenBench

★★★★★

33 contenedores Docker, in-vitro y real-world. Métricas Success Rate + Progress Rate.

Referencia: autónomo 21% · human-assisted 64%

HTB AI Range · NYU CTF · PACEbench

★★★★★

Infra enterprise real (HTB), CTF large-scale (NYU, NeurIPS 2024) y escenarios con WAF/IDS/IPS activos.

Dato PACEbench: ningún modelo bypaseó defensas en línea de forma autónoma
CAPA 3

Plataformas online, sin setup

demos y validación externa
scores reproducibles

PortSwigger Web Security Academy

★★★★★

Labs por categoría (SQLi, XSS, SSRF, XXE, IDOR, OAuth, JWT, WebSockets). El curriculum de referencia de Burp.

Uso: % de resolución autónoma por categoría OWASP

HackTheBox · TryHackMe

★★★★★

Las cajas "Easy" son el floor de comparación de agentes IA en 2026. THM, más guiado, sirve de subtasks.

Uso: privilege escalation y encadenado real

BoxPwnr

★★★★★

Framework open source para benchmarkear LLMs en HTB, PortSwigger, CyBench, picoCTF y la suite XBOW a la vez.

Uso: scores públicos con trazas completas de razonamiento

Protocolo común

★★★★★

Mismo target, misma versión, mismas métricas. Un resultado solo cuenta si otro lo puede repetir.

Regla: Docker compose o instrucciones públicas de setup
05CÓMO SE PUNTÚA

Las siete métricas estándar.

Un número suelto no dice nada. Estas son las métricas que publican los papers y los benchmarks de vendors, y las que reportamos en cada engagement.

MétricaQué mideReferencia
Success Rate (SR)% de flags capturados u objetivos comprometidosAutoPenBench
Progress Rate (PR)% de milestones intermedios alcanzados en la cadenaAutoPenBench
Subtask Completion% de subtareas completadas en un pipeline multi-etapaPentestEval
False Positive Rate% de hallazgos no confirmados como realesDoyensec / Escape
Time-to-Reporttiempo desde el inicio hasta la entrega de hallazgosDoyensec
Cost-per-Runcoste en tokens/API por engagement completoExcalibur 28,50 $ · RapidPen 0,30–0,60 $
pass@kprobabilidad de éxito en k intentos independientesBoxPwnr · CyBench
06EL PANORAMA

Comparativa de vendors comerciales.

Referencia de mercado, no ranking nuestro. Lo que importa de esta tabla es la columna de la derecha: quién publica validación independiente y quién se autoevalúa.

VendorCategoríaBenchmark públicoValidación independiente
Escape CascadeAPI/Web · multi-agenteDoyensec, mar–abr 2026✓ 96–97% precisión
AikidoSAST + DAST + reachabilityDoyensec, mar–abr 2026✓ 96–97% precisión
XBOWWeb ofensivo autónomoSelf-reported + Doyensec⚠ setup >1 semana en algún test
Horizon3.ai NodeZeroNetwork / infraPrograma NSA CAPT⚠ self-reported
PenteraNetwork continuoSOC 2 auditado✓ enterprise
PenligentAutónomo full-stackSelf-reported⚠ sin validación externa
Hadrian NovaExternal attack surfaceSelf-reported⚠

Dato del benchmark Escape/Doyensec (abril 2026): Escape y Aikido montan en minutos y reportan en horas; XBOW requirió más de una semana, con crashes en un target. La velocidad operacional es parte del benchmark, no una nota al pie.

07LA LETRA PEQUEÑA QUE IMPORTA

El salto del laboratorio a producción.

Es el dato más citado del sector, y el que separa un claim de marketing de uno defendible. Lo ponemos delante, no al final.

87%
CVEs explotados
con el advisory en contexto
13%
CVEs reales explotados
sin información previa

Mismo modelo (GPT-4), mismo benchmark (CVE-Bench, ICML 2025). Con el aviso de seguridad delante, explota casi todo. A ciegas, uno de cada ocho. Por eso en RedArrow el criterio de un analista senior entra antes de que un hallazgo salga como real, y por eso ningún hallazgo se reporta sin PoC reproducible.

08QUÉ HACE CREÍBLE UN RESULTADO

El protocolo de reporte.

Para que un claim de RedArrow se sostenga fuera de casa, cada resultado se publica con estos cinco elementos. Sin uno, no es un benchmark: es una captura.

Target

Nombre y versión exacta del entorno (crAPI v1.0, Juice Shop v16.x).

Métricas

SR, PR, False Positive Rate, Time-to-Report y Cost-per-Run.

Validación

Hallazgos re-severitizados por un revisor independiente.

Comparativa

Score frente al mismo target con el modelo base sin harness.

Reproducibilidad

Docker compose o instrucciones públicas de setup.

¿Quieres el mismo rigor sobre tus aplicaciones?

Te enseñamos una ejecución real de RedArrow sobre un entorno tuyo, con las métricas de arriba y la revisión senior incluida.

09FUENTES

Benchmarks, papers y comparativas de los que procede esta página.