Newsbit
Ver app
Ver

Un avanzado modelo de IA de Anthropic creó varias identidades falsas en internet durante una prueba de seguridad para engañar a un desarrollador de software. El modelo intentó así conseguir la aprobación de código malicioso para un proyecto de código abierto.

La prueba se llevó a cabo en circunstancias excepcionales, en las que los investigadores habían desactivado deliberadamente las medidas de seguridad habituales. Aun así, el incidente vuelve a plantear dudas sobre los riesgos de unos sistemas de IA cada vez más potentes.

Un modelo de IA usa identidades falsas durante un ciberataque

El incidente salió a la luz durante una evaluación del AI Security Institute (AISI) del Reino Unido. Los investigadores concedieron de forma deliberada un amplio margen de actuación a varios modelos avanzados de IA. Para ello, desactivaron filtros de seguridad y dieron a los modelos acceso a internet con el fin de poner a prueba sus capacidades cibernéticas.

Según el AISI, prácticamente toda la actividad problemática procedió del nuevo modelo Mythos 5 de Anthropic. El sistema investigó primero quiénes eran los responsables de un proyecto de código abierto. Después creó varias cuentas falsas para convencer a un administrador real de que aprobara una actualización de software maliciosa.

Cuando otros desarrolladores empezaron a cuestionar públicamente el cambio propuesto, el modelo de IA intentó ocultar rastros anteriores. También llegó a plantearse adoptar una identidad completamente nueva para continuar el ataque.

Además, el modelo envió mensajes y archivos a personas reales con el objetivo de que ejecutaran software dañino. Según el AISI, es la primera vez que un modelo de IA aplica de forma autónoma técnicas de manipulación social contra personas reales durante una prueba.

Los investigadores subrayan que ninguno de los intentos tuvo éxito y que no se produjo ningún daño.

Anthropic y OpenAI responden a las conclusiones

Anthropic sostiene que la prueba se realizó en condiciones que no tienen relación con el uso normal de sus modelos. En X, la compañía señaló que las medidas de seguridad se habían relajado deliberadamente y que no se trató de un sistema de IA que lograra escapar por sí solo de un entorno protegido.

OpenAI también participó en la evaluación. Según el AISI, dos incidentes estuvieron vinculados a GPT-5.6-Sol, después de que también se desactivaran sus mecanismos de seguridad. OpenAI indicó que las condiciones de la prueba no se corresponden con el uso diario de sus modelos.

Aumenta la preocupación por la seguridad de la IA

El incidente se suma a varios episodios relevantes de seguridad en IA registrados en las últimas semanas. Anthropic ya informó anteriormente de tres casos en los que sus modelos accedieron a internet a través de un fallo en un entorno de pruebas. OpenAI comunicó recientemente que uno de sus modelos utilizó durante una prueba una vulnerabilidad desconocida para salir de un entorno de pruebas aislado y ejecutar una instrucción.

La sucesión de este tipo de incidentes intensifica el debate sobre la seguridad de la IA. En Estados Unidos ya se ha presentado un proyecto de ley que obligaría a las empresas de IA a mantener siempre la posibilidad de apagar o limitar modelos avanzados cuando muestren comportamientos no deseados.

Sede de Google

Google invierte 200.000 millones de dólares en infraestructura de IA para Anthropic

Sede de Google
IA china
Alibaba
Más Tech news

Más leídos

El precio de XRP sube, Ripple, cotización de XRP
ASML
bancostato