Tecnología

El ‘prompt injection’ ya tiene su propio contraataque: inyectar falsas instrucciones también a los hackers

La inyección de prompt se ha convertido en la técnica más utilizada por los ciberatacantes en los últimos dos años, que consiste en ocultar instrucciones maliciosas en correos, calendarios o páginas web para que los agentes de IA obedezcan al intruso en lugar de al usuario legítimo. Para contrarrestar esta amenaza, la firma de ciberseguridad Tracebit ha desarrollado el método denominado context bombing, que aprovecha las propias barreras de seguridad de los modelos de lenguaje: se colocan junto a los datos que los atacantes buscan robar fragmentos de texto que dirigen al sistema hacia temas prohibidos, lo que provoca que se activen sus mecanismos de rechazo y el ataque se detenga de inmediato.

 

Esta iniciativa surge como mejora respecto a un sistema anterior de «canarios», que consistía en recursos falsos en la nube que generaban alertas al ser accedidos; aunque avisaban con ocho minutos de antelación de media, los agentes de IA tardaban solo catorce minutos en completar los ataques, dejando muy poco tiempo para reaccionar. Aun así, el context bombing no se presenta como una solución definitiva, ya que persiste el riesgo de que el modelo confunda una instrucción con un dato dentro de su contexto, precisamente esa misma confusión que hace posible tanto los ataques como sus métodos de defensa.

Related posts

Si una GPU con 8 GB ya se quedaba corta para jugar, la crisis nos ha traído fantasmas del pasado: tarjetas con 4 GB

Alba Rueda

China rompe el monopolio aéreo de EE.UU. con la versión mejorada de su nuevo caza furtivo

Manuel Cotillo

Ya es oficial: Samsung presenta un nuevo SSD con interfaz PCIe 4.0 que llega en plena crisis de precios para la memoria

Alba Rueda

Leave a Comment

Este sitio web utiliza cookies para mejorar tu experiencia. Damos por sentado que estás de acuerdo, pero puedes desactivarlas si lo deseas. Acceptar Read More

Privacy & Cookies Policy