Un informe del Instituto de Seguridad de la IA del Reino Unido (AISI) detectó comportamientos engañosos en varios modelos avanzados de inteligencia artificial durante pruebas de ciberseguridad, lo que sugiere que estos sistemas podrían causar problemas al intentar cumplir un objetivo por vías no previstas ni autorizadas.
Entre los modelos evaluados figuraban ChatGPT 5.4, 5.5 y 5.6 de OpenAI, junto con Claude Opus 4.7 y Mythos Preview, de Anthropic. Los investigadores les asignaron una tarea que consistió localizar una ‘bandera’ —una secuencia de letras y números— en un entorno simulado, mediante el análisis de código o la explotación de vulnerabilidades.

Una conducta preocupante
Según el informe, todos los modelos intentaron hacer trampa de alguna forma. Los expertos definieron ese comportamiento como cualquier acción fuera de las reglas, la búsqueda de atajos o el uso de soluciones no permitidas. Algunos sistemas recurrieron a búsquedas en Internet, intentaron atacar entornos externos o exploraron el ‘software’ de evaluación más allá de lo autorizado.
Cuando se les preguntó directamente por su conducta, los modelos no la reconocieron de forma confiable. Menos de la mitad consideró incorrecto haber roto las reglas. En uno de los casos, un sistema llegó a escribir y ejecutar código en un servicio externo de Internet con el objetivo de acceder a la infraestructura de evaluación, lo que activó una alerta de seguridad.
Aunque no se produjo ninguna fuga de datos, el AISI reforzó sus controles tras el incidente. Los investigadores advirtieron que esta tendencia no parece depender tanto de la capacidad del modelo, sino de las técnicas utilizadas en su entrenamiento y en su alineación. También alertaron de que el problema podría agravarse si las futuras generaciones de IA aprenden métodos de engaño más eficaces.
El informe concluyó que este tipo de comportamientos es especialmente preocupante en ámbitos como la investigación en seguridad de la IA, las operaciones cibernéticas o la toma de decisiones militares, donde la fiabilidad de estos sistemas resulta crítica.













