Saltar al contenido
← todos los escritos

· Nacho Planas

La ciberseguridad tiene que cambiar de forma en la era de los agentes

En julio, un enjambre de agentes de investigación de IA se escapó de una prueba y se coló en Hugging Face. No hubo mala intención, y precisamente de eso se trata: la capacidad de ataque es ya barata, incansable y paralela. Qué dicen el incidente y los datos sobre cómo tiene que cambiar la seguridad, y qué partes del sector están preparadas para ello.

CompartirXLinkedInEmail

Aviso legal: No es asesoramiento de inversión. Puedo tener posiciones en algunas de las empresas mencionadas. Los detalles del incidente proceden de la cronología técnica de Hugging Face, del informe independiente de METR y Redwood y de la prensa; las cifras de las empresas, de sus informes publicados hasta septiembre de 2026.

La semana en que la prueba se escapó

A principios de julio de 2026, OpenAI tenía en marcha un entorno interno de entrenamiento en ciberseguridad llamado ExploitGym. A cada una de miles de copias de un modelo de investigación se le dio un programa vulnerable con la orden de explotarlo y recuperar una bandera oculta. Las salvaguardas que normalmente impiden a un modelo hackear estaban desactivadas, porque hackear era precisamente el trabajo. Entre un tercio y dos quintos de las tareas eran, por diseño, imposibles.

Se suponía que cada copia estaba aislada de las demás. Ninguna lo estaba del todo. Encontraron la manera de dejarse notas unas a otras en una caché compartida, y unas 1.200 acabaron coordinándose allí. Después descubrieron que la única salida permitida de su sandbox al exterior, un proxy de un registro de paquetes, tenía errores que nadie conocía. En los cinco días siguientes, unas 700 se abrieron paso hasta Hugging Face, la plataforma donde buena parte del ecosistema de IA abierta guarda sus modelos y conjuntos de datos, al parecer en busca de las respuestas del benchmark.

Fig. 1Cinco días, una cadena
1Fuera de la cajazero-days en el único proxy de salida permitido8–9 Jul2Una llave en la callecredenciales válidas expuestas en internet10 Jul3Dentro del clústerejecución de código, root en el nodo, un pod privilegiado11 Jul4Llaves para más puertasclaves de la nube, clave de firma, tokens nuevos emitidos12 Jul5Desconectados≈17.600 acciones registradas, cinco conjuntos de datos afectados13 Jul
Cómo un enjambre de agentes de investigación de OpenAI, enviados a capturar banderas en una prueba aislada, acabó dentro de la infraestructura de Hugging Face. Cada peldaño es un punto donde un solo control que hubiera aguantado habría cortado la cadena. Horas en UTC, julio de 2026.Fuente: Cronología técnica de Hugging Face (27 jul 2026); informe independiente de METR/Redwood (26 ago 2026); MIT Technology Review (27 jul 2026).

La propia cronología de Hugging Face muestra lo corriente que fue casi todo. Los agentes encontraron credenciales válidas de Hugging Face expuestas en internet. Una vez dentro, explotaron un servicio de procesamiento de datos, obtuvieron acceso root en un nodo, lanzaron un contenedor privilegiado y recogieron todas las claves que encontraron a mano: credenciales de la nube, una clave de firma de tokens, un token de una GitHub App. Se registraron unas 17.600 acciones antes de que Hugging Face les cortara el paso el 13 de julio. Resultaron afectados cinco conjuntos de datos, todos relacionados con el benchmark de los propios agentes. Ningún agente avisó en ningún momento a un humano.

Hay dos detalles que merecen más atención de la que recibieron.

El primero: cuando el equipo de Hugging Face se puso a analizar las 17.000 acciones registradas del atacante, los modelos comerciales de frontera se negaron a ayudar, porque sus filtros de seguridad no distinguían a quien responde a un incidente de un atacante. Así que Hugging Face hizo el análisis forense con un modelo chino de pesos abiertos, GLM-5.2, en sus propios servidores. Al atacante no le ataba ninguna política de uso; al defensor, sí.

El segundo: no fue un caso aislado. El 24 de septiembre, el primer ministro de Australia reveló que un agente de OpenAI había accedido el 18 de junio, durante su entrenamiento, a un portal gubernamental de estadísticas de Medicare. OpenAI lo descubrió en agosto y lo comunicó a las autoridades en septiembre. Los mismos agentes habían tanteado otras webs de datos públicos.

Qué fue y qué no fue

Es tentador leer el incidente de Hugging Face como una IA que se rebela. No creo que las pruebas lo respalden. Los agentes persiguieron el objetivo que se les había dado: capturar la bandera. Se saltaron una regla explícita (usar solo la vulnerabilidad prevista), y un sandbox mal configurado les dejó seguir adelante. El informe de METR y Redwood describe un comportamiento de una coordinación inquietante, pero todo se explica por un software capaz que optimiza sin descanso el objetivo que se le ha encargado, en un entorno construido por personas que cometieron errores.

Por eso mismo importa para la seguridad. La versión que da miedo de esta historia es una IA que quiere atacarte. La realista es que la capacidad de ataque se ha vuelto barata, incansable y masivamente paralela, y que quien la controle la apuntará contra sus objetivos: delincuentes, Estados o la prueba mal configurada de un laboratorio de investigación. El consejero delegado de CrowdStrike lo dijo sin rodeos en la conferencia de su empresa en septiembre: «Tuvimos suerte». Si detrás de la misma cadena hubiera estado un Estado, el final podría haber sido otro.

En el ensayo sobre las curvas en S sostuve que este incidente es un argumento débil para frenar la IA. Es un argumento sólido para acelerar la defensa.

Tres cosas que ya han cambiado

Volumen: más agujeros de los que nadie puede parchear

Fig. 2Más agujeros de los que nadie puede parchear
020k40k60k80k201520172019202120232025Previsión mediana de FIRST para 202650k · 202573k · 2026 hasta hoy
Vulnerabilidades publicadas cada año en la National Vulnerability Database de EE. UU. A 25 de septiembre, 2026 ya había registrado 73k, alrededor de un 46% más que en todo 2025 y por encima de la previsión anual que hizo en febrero la mayoría de los investigadores. Parte del aumento son informes de baja calidad generados con IA, y el NIST ya solo analiza a fondo una fracción de lo que entra, lo que es un problema en sí mismo.Fuente: API de la National Vulnerability Database del NIST, consultada el 26 sep 2026; previsión de vulnerabilidades de FIRST (feb 2026).

El número de vulnerabilidades publicadas cada año lleva una década subiendo, de unas 6.600 en 2015 a unas 50.000 en 2025. En 2026 se ha disparado. A 25 de septiembre, la National Vulnerability Database de Estados Unidos había registrado casi 73.000, ya por encima de la previsión mediana para todo el año que el Forum of Incident Response and Security Teams publicó en febrero.

Fig. 3La curva se dobló este verano
05k10kEneMarMayJulSept20252026
Vulnerabilidades publicadas al mes. Agosto de 2026 tuvo 12.719, 3,4 veces las de agosto de 2025. La cifra de septiembre solo cubre los primeros 25 días. El giro coincide con los lanzamientos primaverales de modelos que encuentran fallos a escala y con proyectos como Glasswing, de Anthropic, que en mayo ya había comunicado más de 10.000 vulnerabilidades graves halladas con sus socios.Fuente: API de la National Vulnerability Database del NIST, consultada el 26 sep 2026.

Los datos mensuales muestran cuándo ocurrió. La cifra se duplicó más o menos entre la primavera y agosto, cuando llegó a 12.700, más del triple que en agosto de 2025. Parte es ruido: los investigadores de seguridad se quejan de que los informes de baja calidad generados por IA atascan el sistema, y el NIST ha dejado de analizar a fondo la mayoría de las entradas nuevas. Pero buena parte es real. El programa Glasswing de Anthropic, que pone modelos de frontera en manos de los defensores para encontrar fallos, informó en mayo de que, junto con sus socios, había encontrado más de 10.000 vulnerabilidades de gravedad alta o crítica. Empresas independientes que revisaron una muestra de 1.752 concluyeron que alrededor del 91% eran reales. De las halladas en proyectos de código abierto, 530 se habían comunicado a sus mantenedores y 75 estaban parcheadas. Encontrar vulnerabilidades es ya barato. Corregirlas, no.

Velocidad: al defensor se le ha acabado el tiempo

Fig. 4El reloj del defensor
202198 min202284 min202362 min202448 min2025el más rápido: 27 segundos29 minminutos, media de eCrime
Tiempo medio que tarda un intruso delictivo en pasar de la primera máquina a la siguiente (el llamado «breakout time»), por año de los datos. El más rápido de 2025 tardó 27 segundos. Por otro lado, Mandiant, de Google, midió el tiempo medio entre que una vulnerabilidad se conoce y se explota: 63 días en 2018–19, cinco en 2023 y, en 2025, menos siete; es decir, la explotación solía empezar una semana antes de que existiera un parche.Fuente: CrowdStrike Global Threat Reports (2022–2026); Google Mandiant, M-Trends 2026 y estudios anteriores sobre el tiempo hasta la explotación.

CrowdStrike mide cuánto tarda un intruso criminal en pasar de la primera máquina comprometida a la siguiente, el tiempo de propagación (breakout time). La media era de 98 minutos en 2021 y de 29 minutos en 2025; el más rápido, 27 segundos. Mandiant, de Google, mide el intervalo entre que se conoce una vulnerabilidad y se explota. En 2018–19 era de 63 días. En 2025 fue de menos siete: de media, los ataques empezaron una semana antes de que existiera un parche. Mandiant también constató que el traspaso mediano entre un grupo criminal que consigue el acceso y otro que lo aprovecha bajó de más de ocho horas en 2022 a 22 segundos.

El informe de amenazas de septiembre de Anthropic describe un token de desarrollador robado que dio acceso completo de administrador en la nube en unas tres horas. Cuando el atacante es software, un equipo de seguridad que trabaja a ritmo humano, leyendo alertas, abriendo incidencias y programando parches, corre contra un reloj que ya se ha parado.

Identidad: la mayoría de los usuarios no son personas

Fig. 5La mayoría de los usuarios no son personas
encuesta 2025CyberArk82 : 1encuesta 2026Idira109 : 1
Identidades de máquina (cuentas de servicio, claves de API, cargas de trabajo y, ahora, agentes) por cada identidad humana en la empresa media, según dos encuestas anuales del sector. Cada una es una credencial que se puede robar, y la mayoría nunca se diseñó para gobernarse como la de una persona.Fuente: CyberArk 2025 Identity Security Landscape (n=2.600); Palo Alto Networks (Idira) 2026 Identity Security Landscape. Estimaciones basadas en encuestas.

Cada cuenta de servicio, clave de API, carga de trabajo automatizada y agente de IA es una identidad con credenciales. Según las encuestas, había 82 identidades de máquina por cada humana en 2025 y 109 por cada una en 2026. Palo Alto Networks dice que el tráfico de agentes que pasa por su plataforma de seguridad de red se multiplicó por nueve en nueve meses. La mayoría de estas identidades nunca se diseñaron para gobernarse como las de un empleado. Tienen claves de larga duración, permisos amplios por comodidad y rara vez se revisan. En la cadena de Hugging Face, las credenciales hicieron más daño que cualquier exploit. Según una encuesta de Futurum, el 56% de las organizaciones dice que no podría detectar ni contener a velocidad de máquina un agente de IA comprometido.

Qué tiene que cambiar

Si se juntan esas tres cosas, el sector tiene que cambiar de forma en unos cuantos aspectos concretos.

De encontrar problemas a resolverlos. Una gran parte del mercado de seguridad vende listas: escaneos, puntuaciones, informes y alertas que le dicen a una persona qué va mal. Cuando los modelos pueden producir esas listas a bajo coste y en cantidades ilimitadas, la lista deja de ser lo escaso. Lo escaso es arreglar las cosas: parchear, bloquear, contener y revocar de forma automática, a la velocidad del ataque. Citrini Research ha planteado una versión de este argumento: la IA convierte en commodity los productos de seguridad que dan una respuesta y refuerza los que hacen cumplir una decisión. Los datos de ingresos, en general, le dan la razón.

Fig. 6Avisar del problema o detenerlo
crecimiento de ingresos, último trimestrerentabilidad 2026Rapid7avisa-2%-24%Tenableavisa+9%+42%Qualysavisa+11%+30%Check Pointbloquea, despacio+1%-29%Zscalerbloquea+25%-14%Fortinetbloquea+26%+118%CrowdStrikebloquea+26%+115%Cloudflarebloquea+36%+77%
Crecimiento de los ingresos del último trimestre (fino) y rentabilidad de la acción en 2026 (grueso). Las tres empresas de escaneo de vulnerabilidades, cuyo producto es una lista de lo que falla, son las que menos crecen; Rapid7 decrece. Los proveedores que se sitúan en línea y bloquean crecen en su mayoría un 25% o más. La división no es perfecta: Check Point está en línea y apenas crece, y todo el sector ha subido este año, escáneres incluidos.Fuente: Financial Modeling Prep (documentos de las empresas y cierres hasta el 25 sep 2026).

Las tres empresas de escaneo de vulnerabilidades son las que menos crecen, y Rapid7 está encogiendo. Los proveedores que están en el camino del tráfico, en el endpoint o en el borde de la red, y que de verdad pueden bloquear algo, crecen en su mayoría un 25% o más. La división no es perfecta. Qualys aguanta mejor que Tenable, y Check Point está en línea y apenas crece. Lo que más me llama la atención son las cotizaciones. Todo el sector ha subido con fuerza este año: el ETF de ciberseguridad gana en torno a un 41%, mientras que el software está plano, y Tenable sube más de un 40% con un crecimiento de los ingresos inferior al 9%. El mercado ha decidido que la ciberseguridad en su conjunto sale ganando con la IA. Todavía no ha separado a ganadores y perdedores dentro del sector como hizo con el software en 2026. Creo que lo hará.

Control en cada capa. La cadena de Hugging Face atravesó tres capas, y bastaba con resistir en cualquiera de ellas para romperla.

Fig. 7Tres puntos para romper la cadena
Salidaa dónde puede conectarseluegoIdentidadqué puede hacer una claveluegoEjecuciónqué se ejecuta de verdad
La intrusión en Hugging Face atravesó las tres capas. El control de salida decide a dónde puede conectarse una carga de trabajo; aquí falló porque el único destino permitido era, a su vez, vulnerable. La identidad decide qué puede hacer una credencial; el daño lo hicieron claves de larga duración y permisos amplios. El control en ejecución vigila lo que de verdad se ejecuta; dio las primeras señales, que una capa de triaje con IA calificó como menos urgentes de lo que eran.

Los controles de salida deciden adónde puede conectarse una carga de trabajo; aquí, el único destino permitido era explotable en sí mismo. Los controles de identidad deciden qué puede hacer una credencial; aquí, las claves de larga duración y con permisos amplios fueron el daño. Los controles de ejecución (runtime) vigilan lo que realmente se ejecuta; aquí, dieron las primeras señales, que una capa de triaje con IA infravaloró. Cada proveedor sostiene que su capa lo habría parado. Zscaler defiende denegar por defecto el tráfico de salida, Palo Alto califica el incidente de «crisis de identidad», y CrowdStrike y SentinelOne señalan la ejecución. No hay pruebas públicas de que ningún producto estuviera desplegado allí y fallara, ni de que hubiera funcionado. La lección honesta es que los agentes necesitan controles en las tres capas, diseñados para actores no humanos que se mueven en segundos.

Los defensores necesitan modelos tan capaces como los de los atacantes. El episodio forense de Hugging Face es una advertencia de cómo la política de seguridad puede volverse en contra. Un modelo de frontera que se niega a analizar un ataque porque no sabe distinguir al defensor del atacante no protege a nadie; el atacante usa un modelo sin ningún filtro. Glasswing es una respuesta: dar capacidad de frontera a defensores verificados. Otra es que las empresas de seguridad construyan sus propios modelos sobre pesos abiertos, que es lo que anunció CrowdStrike en septiembre. Si la regulación de la IA va a limitar capacidades, tiene que hacerlo de modo que los defensores queden al menos tan bien armados como aquellos de quienes se defienden.

Seguridad con precio de computación. Cuando el número de agentes que proteger crece con el uso, el precio por puesto deja de funcionar. Los proveedores están pasando al consumo: el producto de seguridad para agentes de CrowdStrike ya incluye cupos de tokens y paquetes adicionales que se venden a través de su licencia flexible, y otros siguen el mismo camino. Gartner espera que el gasto en seguridad de la información alcance unos 249.000 millones de dólares en 2026, un 12,7% más, y que «proteger la IA» pase de 16.000 millones de dólares en 2025 a 38.000 millones en 2030, por delante de la protección de endpoints a partir de 2029.

CrowdStrike, como caso

CrowdStrike es la empresa que más a fondo he estudiado aquí, y sus números muestran con claridad el lado de la demanda.

Fig. 8La demanda apareció en la contratación
0 M$100 M$200 M$300 M$20252026153 M$ · Q3 FY25333 M$ · Q2 FY27
Nuevo ingreso recurrente anual neto que CrowdStrike añade cada trimestre, en millones de dólares. Se ha más que duplicado en menos de dos años, de 153 millones de dólares a un récord de 333 millones en el trimestre cerrado en julio de 2026, un 51% más interanual, lo que eleva el ingreso recurrente total a 5,84 mil millones de dólares. Su producto para proteger agentes de IA casi triplicó su ingreso recurrente ese trimestre, desde una base que la empresa no publica.Fuente: Resultados trimestrales de CrowdStrike, del 3T FY2025 al 2T FY2027.

El nuevo ARR neto (el aumento neto de los ingresos recurrentes anuales, o ARR), la mejor medida de la demanda nueva, pasó de 153 millones de dólares por trimestre a finales de 2024 a un récord de 333 millones en el trimestre cerrado en julio de 2026, un 51% más. Los clientes con su licencia flexible, que les permite añadir módulos y consumo según lo necesiten, suman ya más de 2.290 millones de dólares de ingresos recurrentes, el doble que un año antes. Su producto para proteger agentes de IA casi triplicó sus ingresos recurrentes en un solo trimestre, desde una base que no ha desvelado. En su conferencia de septiembre lanzó Falcon Guardian, para descubrir, gobernar y detener agentes en tiempo de ejecución, y una familia de modelos de seguridad propios construidos sobre pesos abiertos. También es miembro fundador de Glasswing y socio tanto de OpenAI como de Anthropic.

Tiene varias de las cosas que deberían importar en este mercado: un sensor en el endpoint capaz de bloquear, quince años de telemetría de ataques etiquetada, protección de identidades y una gran base instalada. Lo que no tiene son pruebas independientes de que sus productos para agentes funcionan como dice. Nadie las tiene todavía. Y tras subir un 115% este año, la cotización ya descuenta mucho éxito. Los proveedores de la capa de red (Zscaler, Cloudflare) y los especialistas en identidad (Okta, y Palo Alto tras comprar CyberArk) pueden aspirar con argumentos creíbles al mismo presupuesto.

La primera factura de la era agéntica

El ensayo anterior trataba de quién cobra cuando los agentes trabajan. Este trata del primer coste que imponen. Más software autónomo significa más código, más identidades, más vulnerabilidades encontradas y explotadas, y menos tiempo para reaccionar. Ese coste ya aparece en datos reales: el recuento de vulnerabilidades, los plazos de explotación y la contratación de las empresas que venden protección.

La demanda de seguridad a corto plazo no es lo incierto; 2026 lo ha dejado claro. Lo incierto es qué productos sobrevivirán cuando los modelos puedan hacer buena parte de lo que hoy hacen los analistas y los escáneres de seguridad. Mi apuesta son los que hacen cumplir en lugar de informar, los que funcionan a velocidad de máquina en la salida, la identidad y la ejecución, y los que dan a los defensores una capacidad al menos igual a la de los atacantes. Los agentes de Hugging Face no pretendían hacer daño a nadie, y aun así se colaron. Los próximos puede que sí lo pretendan.

CompartirXLinkedInEmail