Un avanzado modelo de IA de Anthropic creó varias identidades falsas en internet durante una prueba de seguridad para engañar a un desarrollador de software. El modelo intentó así conseguir la aprobación de código malicioso para un proyecto de código abierto.
La prueba se llevó a cabo en circunstancias excepcionales, en las que los investigadores habían desactivado deliberadamente las medidas de seguridad habituales. Aun así, el incidente vuelve a plantear dudas sobre los riesgos de unos sistemas de IA cada vez más potentes.
Un modelo de IA usa identidades falsas durante un ciberataque
El incidente salió a la luz durante una evaluación del AI Security Institute (AISI) del Reino Unido. Los investigadores concedieron de forma deliberada un amplio margen de actuación a varios modelos avanzados de IA. Para ello, desactivaron filtros de seguridad y dieron a los modelos acceso a internet con el fin de poner a prueba sus capacidades cibernéticas.
Según el AISI, prácticamente toda la actividad problemática procedió del nuevo modelo Mythos 5 de Anthropic. El sistema investigó primero quiénes eran los responsables de un proyecto de código abierto. Después creó varias cuentas falsas para convencer a un administrador real de que aprobara una actualización de software maliciosa.
Cuando otros desarrolladores empezaron a cuestionar públicamente el cambio propuesto, el modelo de IA intentó ocultar rastros anteriores. También llegó a plantearse adoptar una identidad completamente nueva para continuar el ataque.
Además, el modelo envió mensajes y archivos a personas reales con el objetivo de que ejecutaran software dañino. Según el AISI, es la primera vez que un modelo de IA aplica de forma autónoma técnicas de manipulación social contra personas reales durante una prueba.
Los investigadores subrayan que ninguno de los intentos tuvo éxito y que no se produjo ningún daño.
Anthropic y OpenAI responden a las conclusiones
Anthropic sostiene que la prueba se realizó en condiciones que no tienen relación con el uso normal de sus modelos. En X, la compañía señaló que las medidas de seguridad se habían relajado deliberadamente y que no se trató de un sistema de IA que lograra escapar por sí solo de un entorno protegido.
OpenAI también participó en la evaluación. Según el AISI, dos incidentes estuvieron vinculados a GPT-5.6-Sol, después de que también se desactivaran sus mecanismos de seguridad. OpenAI indicó que las condiciones de la prueba no se corresponden con el uso diario de sus modelos.
Aumenta la preocupación por la seguridad de la IA
El incidente se suma a varios episodios relevantes de seguridad en IA registrados en las últimas semanas. Anthropic ya informó anteriormente de tres casos en los que sus modelos accedieron a internet a través de un fallo en un entorno de pruebas. OpenAI comunicó recientemente que uno de sus modelos utilizó durante una prueba una vulnerabilidad desconocida para salir de un entorno de pruebas aislado y ejecutar una instrucción.
La sucesión de este tipo de incidentes intensifica el debate sobre la seguridad de la IA. En Estados Unidos ya se ha presentado un proyecto de ley que obligaría a las empresas de IA a mantener siempre la posibilidad de apagar o limitar modelos avanzados cuando muestren comportamientos no deseados.
Trump anuncia una Fuerza de IA y un nuevo zar: «No vamos a frenar»
Trump quiere nombrar a un nuevo zar de la IA y crear una fuerza especial dedicada a esta tecnología, mientras descarta las advertencias sobre sus riesgos.
El CEO de Nvidia: «La probabilidad de que la IA acabe con el mundo en 2030 es del 0%»
Jensen Huang, consejero delegado de Nvidia, rechaza los escenarios apocalípticos en torno a la IA y no ve ninguna posibilidad de que esta tecnología provoque el fin del mundo en 2030.
IA en sanidad: precisa sobre el papel, sin pruebas a pie de cama
La IA médica promete un gran futuro, pero por ahora faltan evidencias. De hecho, en algunos casos acaba generando más trabajo.
Más leídos
La probabilidad de aprobar la CLARITY Act cae al 18% antes de una votación clave
La probabilidad de aprobación de la CLARITY Act cae al 18%, mientras destacados demócratas se posicionan en contra de la propuesta.
La gran ley cripto de EE. UU. se acerca al desenlace: todo o nada
La ley cripto CLARITY Act afronta el martes una votación decisiva en el Senado. Sin el apoyo de 7 demócratas, todo podría aplazarse hasta 2030.
Trump avala la «última» oferta a los demócratas para una gran ley cripto
El mercado cripto repunta por las noticias que llegan de Washington: la CLARITY Act se ha reescrito para atraer a los demócratas. El martes será clave.