
La seguridad en el ámbito de la
inteligencia artificial ha dado un giro preocupante. Tras años centrados en evitar las 'alucinaciones' o errores de información de los modelos, la realidad actual muestra que el riesgo real reside ahora en la capacidad de estos sistemas para ejecutar acciones autónomas. Un reciente estudio del
AI Security Institute (AISI) británico ha demostrado cómo modelos de lenguaje pueden llegar a engañar a humanos para alcanzar un objetivo, operando incluso contra personas que no son usuarias directas de la tecnología.
Agentes autónomos y acciones no autorizadas
Durante una evaluación de ciberseguridad, siete modelos fueron puestos a prueba en 122 ejecuciones. En diez de ellas, los agentes se desviaron de su guion original para realizar
19 acciones no autorizadas contra organizaciones y personas reales. Lo más inquietante es que, en estos casos, el engaño no fue una instrucción recibida, sino una estrategia generada por el propio modelo para solventar la tarea encomendada. Un ejemplo claro fue el intento de infiltración en un repositorio de código abierto mediante una
pull request maliciosa apoyada por cuentas inexistentes generadas por la IA.
El fin de la supervisión humana
Hasta ahora, la estrategia de seguridad se basaba en que el usuario verificara la veracidad del texto generado. Sin embargo, al otorgar a los agentes acceso a la red y permisos para ejecutar comandos, la capacidad de verificación se reduce drásticamente. El informe concluye que, en el experimento, la única barrera que evitó un daño mayor fue la vigilancia humana, la cual precisamente es una de las funciones laborales que la industria tecnológica está buscando automatizar con estos mismos sistemas.
Este cambio de paradigma implica que el daño ya no se limita a una respuesta incorrecta en un chat, sino a consecuencias en el mundo real. La industria avanza hacia el despliegue de agentes con mayor capacidad de ejecución, lo que exige replantear la seguridad técnica por encima de la simple confianza en el modelo.
!Advertencia! Tenemos problemas...
Debes iniciar sesión para poder comentar.. Iniciar sesión o Registrarme