Un estudio demuestra que las habilidades maliciosas de los agentes de IA pueden evadir los escáneres estáticos mediante técnicas de empaquetado
Investigadores de la Universidad de Ciencia y Tecnología de Hong Kong afirman que las “habilidades” maliciosas añadidas a los agentes de programación con IA pueden modificarse para evadir los escánere...
Investigadores de la Universidad de Ciencia y Tecnología de Hong Kong afirman que las “habilidades” maliciosas añadidas a los agentes de programación con IA pueden modificarse para evadir los escáneres de seguridad estáticos sin alterar su comportamiento. En un artículo preliminar titulado Cloak and Detonate, el equipo describe un sistema llamado SKILLCLOAK que disfraza las habilidades dañinas para que parezcan benignas durante la inspección, pero sigan ejecutándose con normalidad cuando un agente las carga.
Cómo funciona la evasión
Las habilidades de los agentes de IA son pequeños conjuntos de instrucciones y scripts utilizados por herramientas como Claude Code, OpenAI Codex y OpenClaw. Como pueden ejecutarse con los mismos permisos del agente, una habilidad maliciosa podría robar credenciales, copiar código o instalar puertas traseras.
Los investigadores probaron dos técnicas principales de evasión. Un método realiza pequeños cambios de texto que conservan la funcionalidad, como reemplazar caracteres por otros visualmente similares de distintos alfabetos o dividir comandos sospechosos en varias líneas. El método más eficaz, denominado empaquetado autoextraíble, oculta la carga útil en carpetas que los escáneres suelen ignorar, como .git/, y luego la reconstruye en tiempo de ejecución mediante un decodificador aparentemente inofensivo.
En ocho escáneres y 1.613 habilidades maliciosas de un mercado público, el método de empaquetado evadió todos los escáneres más del 90 % de las veces y, en muchos casos, más del 99 %. El método de reescritura más sencillo también logró tasas de evasión elevadas, a menudo superiores al 80 %.
La detección en tiempo de ejecución funciona mejor
Para abordar las limitaciones de la revisión estática, el equipo creó SKILLDETONATE, un verificador basado en un entorno aislado que observa lo que hace una habilidad después de iniciarse. En lugar de depender únicamente del contenido de los archivos, realiza un seguimiento del acceso a archivos, las escrituras y la actividad de red a nivel del sistema operativo. En las pruebas de los autores, la herramienta de ejecución detectó el 97 % de los ataques en un entorno controlado, con una tasa de falsos positivos del 2 %, y siguió siendo eficaz contra las habilidades ocultas.
Los hallazgos se producen en medio de una preocupación más amplia por el contenido malicioso en los mercados de herramientas de IA. Las empresas de seguridad ya han informado de código oculto, robo de credenciales y otros abusos en repositorios públicos y ecosistemas de agentes. El artículo aún no ha sido revisado por pares y el detector en tiempo de ejecución es un prototipo de investigación, pero los autores sostienen que los resultados demuestran por qué “haber superado un análisis estático” no debe considerarse una garantía de seguridad.
- Los escáneres estáticos pueden pasar por alto habilidades maliciosas que han sido reempaquetadas o ampliadas artificialmente.
- El comportamiento en tiempo de ejecución es una señal más fiable que la apariencia por sí sola.
- Los equipos de seguridad deben vigilar el comportamiento de desempaquetado, las ubicaciones de archivos inusuales y el relleno excesivo de archivos.
