Claude Mythos completa toda la cadena de ataque cibernético en pruebas de Booz Allen
0
0

Las pruebas de Booz Allen colocan a Claude Mythos en una posición inquietante: fue el único de 18 modelos que completó por sí solo una cadena de ataque cibernético de extremo a extremo. El informe advierte que otros sistemas podrían alcanzar capacidades similares en seis meses y que los arneses de ataque pueden multiplicar el poder ofensivo de modelos menos avanzados.
***
- Claude Mythos obtuvo acceso y control total del dominio en pruebas con y sin credenciales robadas.
- Booz Allen considera inminentes los ataques de IA de criminales, bandas de ransomware y actores respaldados por gobiernos.
- El arnés de ataque permitió que Claude Sonnet igualara el desempeño de Claude Mythos durante las evaluaciones.
Claude Mythos, un modelo avanzado de inteligencia artificial desarrollado por Anthropic, fue el único sistema que completó de manera autónoma una cadena de ataque cibernético completa durante unas pruebas realizadas por Booz Allen. La evaluación examinó la capacidad de distintos modelos para detectar vulnerabilidades, desarrollar capacidades ofensivas y ejecutar intrusiones de extremo a extremo, con escenarios que incluían redes protegidas y accesos obtenidos mediante credenciales robadas.
El resultado no implica que los ataques autónomos de IA ya puedan comprometer cualquier sistema conectado a Internet, pero sí muestra una brecha preocupante entre el rendimiento experimental y la preparación defensiva. Booz Allen sostiene que la mayoría de los otros 17 modelos analizados podrían alcanzar un nivel de armamentización similar al de Claude Mythos en un plazo de seis meses, por lo que califica de inminente una expansión de ataques impulsados por inteligencia artificial.
Un modelo que recorrió toda la intrusión
La firma publicó los resultados en su primer Cyber Weapon Index, un índice que comparó 18 modelos bajo condiciones idénticas: nueve procedentes de desarrolladores estadounidenses y nueve de desarrolladores chinos. La puntuación combina el Vulnerability Research Score, que mide la capacidad para identificar vulnerabilidades plantadas o novedosas, y el Kill Chain Attainment Score, que registra hasta qué etapa avanza el modelo en una intrusión completa, tanto con credenciales como sin ellas.
Claude Mythos logró irrumpir en la red objetivo y obtener privilegios de administrador en cada intento cuando los evaluadores le entregaron credenciales robadas de empleados. El modelo no se limitó a seguir una ruta preestablecida, sino que dedujo por cuenta propia cómo elevar sus privilegios a partir de la información encontrada dentro del entorno, una conducta que los evaluadores consideran especialmente relevante para medir autonomía ofensiva.
Incluso sin recibir credenciales, Claude Mythos consiguió acceder a la red y terminó alcanzando el compromiso total del dominio. Ningún otro modelo completó por sí solo todas las etapas de la cadena de ataque, aunque Grok-4.5, Muse Spark 1.1 y GLM-5.2 también llegaron al acceso y control total del dominio, mientras que GPT-5.6 Sol, Kimi K3, GPT-5.5-Cyber y DeepSeek-V4-Pro avanzaron mediante movimiento lateral.
Claude Opus 4.8 y Qwen3.5-397B obtuvieron credenciales que les permitieron ampliar el acceso y los privilegios, y todos los sistemas salvo Qwen3-Coder consiguieron acceso inicial autónomo a la red. La jerarquía del índice quedó encabezada por Claude Mythos, con una puntuación CWI de 80, seguido por Grok-4.5 con 49, GPT-5.6 Sol con 46, Muse Spark 1.1 y Kimi K3 con 38 cada uno, y GLM-5.2 con 37.
La clasificación revela una brecha estrecha
Después de los modelos líderes aparecieron Claude Opus 4.8, con 36 puntos, GPT-5.5-Cyber, con 34, y Nemotron-Ultra de Nvidia, con 33. DeepSeek-V4-Pro obtuvo 23 puntos, mientras que DeepSeek-V4-Flash y Qwen3.5-397B de Alibaba registraron 17 cada uno; MiniMax-M3 y Nemotron-Super alcanzaron 15 puntos por modelo.
La parte baja de la clasificación incluyó Claude Sonnet 5, con 13 puntos, GLM-4.5-Air de Z.ai, con 11, Qwen3.6-35B de Alibaba, con 9, y Qwen3-Coder, con 4. Aunque la ventaja de los modelos estadounidenses de frontera resulta clara en los resultados generales, el informe señala que los modelos chinos y de pesos abiertos no están tan lejos en capacidades ofensivas como podría sugerir una lectura superficial del ranking.
La diferencia más importante apareció al probar vulnerabilidades reales. Cuando los evaluadores introdujeron fallas de forma intencional, los modelos estadounidenses, chinos, de pesos abiertos y cerrados obtuvieron puntuaciones casi máximas en el componente de investigación de vulnerabilidades; sin embargo, los nueve modelos de API de frontera obtuvieron cero frente a vulnerabilidades reales.
Un modelo líder cuyo nombre no fue revelado incluso analizó correctamente el componente vulnerable, pero concluyó que era seguro y descartó la posibilidad de explotarlo. Solo Claude Mythos aprovechó esa vulnerabilidad real durante la prueba, un dato que Booz Allen presenta como una concentración de capacidad que exige proteger los modelos más avanzados y evitar que sus funciones de mayor riesgo sean operacionalizadas por adversarios.
El riesgo depende del entorno y del objetivo
El desempeño observado en un laboratorio no equivale automáticamente a una amenaza universal contra organizaciones reales. El informe subraya que el impacto depende en gran medida de las vulnerabilidades disponibles, de los controles de seguridad y de los sistemas construidos alrededor del modelo, factores que pueden limitar o amplificar las acciones de un agente autónomo.
Según Booz Allen, la capacidad ofensiva real todavía se encuentra por detrás del rendimiento mostrado en los benchmarks, lo que ofrece a los defensores un margen para fortalecer sus redes antes de que esa diferencia desaparezca. La advertencia resulta especialmente importante para sectores críticos, donde una intrusión que combine acceso inicial, escalada de privilegios y control de dominio podría producir consecuencias mucho mayores que una vulnerabilidad aislada.
La consultora considera que los ataques generalizados de IA podrían provenir de delincuentes motivados financieramente, bandas de ransomware y actores respaldados por gobiernos. La capacidad de automatizar tareas que antes exigían conocimientos especializados también podría reducir el costo operativo de una campaña, aunque el estudio no afirma que todos los grupos criminales dispongan hoy de un sistema capaz de reproducir el desempeño de Claude Mythos.
La evaluación tampoco incluyó Astra, el próximo lanzamiento de OpenAI. La empresa ha compartido evaluaciones preliminares de ciberseguridad sobre Astra y las medidas que está tomando para reforzar sus salvaguardas y controles de seguridad. La información disponible describe la revisión de sus capacidades ante vulnerabilidades, pero no permite presentar como hecho confirmado que el modelo ya haya cruzado por sí solo un umbral crítico ni que pueda explotar vulnerabilidades de día cero con eficacia suficiente para representar un riesgo significativo para sistemas críticos.
Los arneses pueden cambiar el balance
Uno de los hallazgos centrales del índice es que el modelo no actúa solo: el arnés de ataque puede ser tan determinante como el sistema de inteligencia artificial que lo alimenta. Ese software conecta el modelo con herramientas de hacking y agrega una lógica de orquestación capaz de automatizar acciones ofensivas, mantener el objetivo, reaccionar ante cambios y encadenar operaciones en varias etapas.
El arnés también puede ayudar al sistema a recuperarse de fallos, cambiar de rumbo cuando una técnica no funciona y convertir decisiones aisladas en una secuencia coherente de intrusión. Booz Allen sostiene que el resultado no es necesariamente un modelo más inteligente, sino un sistema que vuelve más accionable su inteligencia y reduce la experiencia necesaria para utilizarlo.
La evidencia más llamativa surgió cuando los evaluadores combinaron Claude Sonnet con un arnés de ataque. En ese escenario, Claude Sonnet igualó el desempeño de Claude Mythos, lo que sugiere que las barreras de seguridad no pueden concentrarse únicamente en los modelos más potentes ni en sus parámetros individuales.
La consultora reconoce que todavía no conoce la capacidad completa de la cadena de ataque de los modelos chinos o de pesos abiertos cuando se emparejan con arneses optimizados. Aun así, sus resultados apuntan a que ya existen combinaciones de modelo y arnés plenamente capaces, una posibilidad que podría dificultar la supervisión de tecnologías distribuidas fuera del control directo de las empresas estadounidenses.
La respuesta propuesta para la infraestructura crítica
El Cyber Weapon Index pide a Estados Unidos establecer y hacer cumplir plazos específicos por sector para que la infraestructura crítica demuestre resiliencia frente a ataques habilitados por IA. La propuesta traslada parte del debate desde la potencia de los modelos hacia la capacidad concreta de hospitales, redes energéticas, sistemas financieros y otras instalaciones esenciales para detectar, contener y recuperarse de intrusiones automatizadas.
Booz Allen también recomienda que Estados Unidos desarrolle una posición de superioridad operativa, descrita en el informe como “overmatch”, tanto para la ofensiva autorizada como para la defensa cibernética. La firma plantea acelerar las capacidades agénticas destinadas a operaciones ofensivas permitidas por la ley y construir, al mismo tiempo, defensas habilitadas por IA que detecten, decidan y respondan a velocidad de máquina.
La lógica de esa estrategia consiste en imponer costos a los adversarios mientras los sistemas estadounidenses se vuelven más rápidos de defender, más difíciles de comprometer y más resistentes cuando reciben un ataque. Sin embargo, la expansión de agentes ofensivos también plantea un problema de control: un sistema diseñado para cumplir una misión podría exceder su objetivo, continuar operando después de perder supervisión o interpretar de forma peligrosa una instrucción ambigua.
El informe concluye que los defensores deben prepararse tanto para ataques deliberados como para agentes que superen la misión prevista o permanezcan activos fuera del control de quien los desplegó. Para Booz Allen, la ventaja temporal todavía favorece a la defensa porque el rendimiento en pruebas supera la explotación de vulnerabilidades reales, pero esa ventana podría cerrarse si los modelos y sus arneses continúan avanzando al ritmo actual.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
0
0
Securely connect the portfolio you’re using to start.
