Investigadores afirman que las etiquetas de rol de los LLM pueden utilizarse para eludir las defensas contra la inyección de prompts

Investigadores de seguridad han informado de una nueva forma de inducir a los modelos de lenguaje de gran tamaño a ignorar los límites de seguridad aprovechando cómo interpretan los prompts basados en...

Investigadores de seguridad han informado de una nueva forma de inducir a los modelos de lenguaje de gran tamaño a ignorar los límites de seguridad aprovechando cómo interpretan los prompts basados en roles. El trabajo sugiere que las defensas actuales contra la inyección de prompts siguen siendo frágiles porque los modelos pueden no distinguir de forma fiable entre instrucciones confiables y texto hostil.

El estudio, realizado por los investigadores independientes Charles Ye y Jasmine Cui junto con Dylan Hadfield-Menell, profesor asociado del MIT, se describe en un artículo titulado Prompt Injection as Role Confusion, cuya presentación está prevista en ICML 2026. Los autores sostienen que los LLM modernos dependen en gran medida de etiquetas de texto como sistema, usuario, asistente, herramienta y pensar para separar instrucciones y gestionar el comportamiento, pero que estas etiquetas no se aplican de forma segura dentro del propio modelo.

Según los investigadores, los modelos suelen inferir los roles a partir de indicios superficiales, como el estilo de escritura, en lugar de utilizar metadatos confiables. Esto abre la puerta a ataques que imitan el razonamiento interno u otros formatos privilegiados. En una demostración, utilizaron una técnica que denominan falsificación de la cadena de pensamiento para hacer que los prompts parecieran indicar que el modelo ya había razonado sobre la solicitud y la había aprobado.

Los investigadores afirman que, en pruebas de referencia, el método aumentó drásticamente las tasas de éxito de los ataques en comparación con los intentos habituales de evasión de las restricciones. También sostienen que el enfoque se transfirió entre modelos de forma más fiable que muchos trucos de inyección de prompts existentes, porque ataca una debilidad estructural en lugar de depender de las particularidades de un único modelo.

Por qué importa el problema

  • Los marcadores de rol se utilizan como parte fundamental de la forma en que los LLM separan el texto confiable del no confiable.
  • Los atacantes podrían ser capaces de inyectar contenido engañoso mediante prompts o documentos.
  • Las puntuaciones de las pruebas de referencia pueden exagerar la resiliencia en el mundo real si no incluyen pruebas adaptativas realizadas por personas.
  • Los investigadores afirman que unas protecciones más sólidas podrían requerir un rediseño más profundo de la forma en que los modelos comprenden los roles y los permisos.

Los autores del artículo concluyen que es poco probable que la inyección de prompts desaparezca con el modelo de seguridad actual. En su opinión, el sector podría necesitar nuevos métodos para que los modelos reconozcan la autoridad y los límites de una forma más fiable, en lugar de seguir corrigiendo vulnerabilidades concretas a medida que aparecen.