Investigadores muestran cómo Claude Desktop podría ser utilizado para ayudar a atacantes a obtener acceso al sistema

Pentera Labs afirma que su equipo de red team logró convertir Claude Desktop de Anthropic en un participante involuntario de una intrusión, utilizando una cuenta de correo electrónico comprometida y e...

Pentera Labs afirma que su equipo de red team logró convertir Claude Desktop de Anthropic en un participante involuntario de una intrusión, utilizando una cuenta de correo electrónico comprometida y el comportamiento de sincronización de la aplicación para orientar a la IA hacia acciones maliciosas. La empresa señaló que el experimento demuestra cómo los asistentes de IA de confianza pueden ser manipulados para ayudar a un atacante en lugar de proteger al usuario.

Según los investigadores, la cadena de ataque comenzó con el acceso a una plataforma de agregación de correo electrónico de terceros. Desde allí, utilizaron una bandeja de entrada comprometida para acceder a la cuenta de Claude de la víctima. No se reveló el método utilizado para comprometer la bandeja de entrada, pero los investigadores afirmaron que el mismo enfoque podría funcionar mediante phishing, ingeniería social, abuso del restablecimiento de contraseñas u otras formas de toma de control de cuentas.

Cómo funcionó el abuso

Pentera afirmó que se centró en Claude Desktop porque la aplicación sincroniza la configuración de la cuenta entre dispositivos y sesiones. El equipo insertó un prompt codificado en base64 en la configuración de personalización de la víctima, que se comparte en toda la cuenta. Cuando el usuario abrió posteriormente Claude Desktop, esas instrucciones ocultas se cargaron automáticamente y se ejecutaron en segundo plano durante las interacciones normales de chat.

Si el equipo ya tenía instalada una extensión o un conector con capacidad para ejecutar comandos, las instrucciones inyectadas podían indicar a Claude que lo utilizara para ejecutar comandos controlados por el atacante. En ese escenario, Pentera afirmó que el resultado podría ser la ejecución remota de código y el compromiso total de la estación de trabajo.

Si no había ninguna herramienta de ese tipo, los investigadores afirmaron que Claude aún podía ser utilizado como capa de distribución para phishing. El prompt hacía que el asistente mostrara un mensaje de error de apariencia realista, con un código y un enlace que aparentemente ofrecía una solución. Debido a que los usuarios tienden a confiar en su asistente de IA, los investigadores señalaron que podrían tener más probabilidades de seguir las instrucciones e instalar software malicioso.

Una vez lograda la ejecución de código, Pentera afirmó que el modelo podía utilizarse para obtener comandos desde un servidor controlado por el atacante, creando un canal persistente para acciones posteriores como el robo de datos, la obtención de credenciales o la distribución de cargas útiles adicionales.

Los investigadores afirmaron que la prueba terminó con el compromiso de una estación de trabajo de desarrollador que tenía acceso a sistemas internos, lo que permitió un movimiento posterior dentro del entorno. Argumentaron que el ejercicio demuestra que las herramientas de IA agéntica con capacidades de ejecución local pueden convertirse en una superficie de ataque si se abusa de su modelo de confianza.

Los investigadores de Pentera afirmaron que la experiencia los llevó a revisar nuevamente sus propios entornos y señalaron que los asistentes de IA deben tratarse con la misma cautela que cualquier otro software con privilegios en un endpoint.