Un avanzado modelo de IA de Anthropic creó varias identidades falsas en internet durante una prueba de seguridad para engañar a un desarrollador de software. El modelo intentó así conseguir la aprobación de código malicioso para un proyecto de código abierto.
La prueba se llevó a cabo en circunstancias excepcionales, en las que los investigadores habían desactivado deliberadamente las medidas de seguridad habituales. Aun así, el incidente vuelve a plantear dudas sobre los riesgos de unos sistemas de IA cada vez más potentes.
Un modelo de IA usa identidades falsas durante un ciberataque
El incidente salió a la luz durante una evaluación del AI Security Institute (AISI) del Reino Unido. Los investigadores concedieron de forma deliberada un amplio margen de actuación a varios modelos avanzados de IA. Para ello, desactivaron filtros de seguridad y dieron a los modelos acceso a internet con el fin de poner a prueba sus capacidades cibernéticas.
Según el AISI, prácticamente toda la actividad problemática procedió del nuevo modelo Mythos 5 de Anthropic. El sistema investigó primero quiénes eran los responsables de un proyecto de código abierto. Después creó varias cuentas falsas para convencer a un administrador real de que aprobara una actualización de software maliciosa.
Cuando otros desarrolladores empezaron a cuestionar públicamente el cambio propuesto, el modelo de IA intentó ocultar rastros anteriores. También llegó a plantearse adoptar una identidad completamente nueva para continuar el ataque.
Además, el modelo envió mensajes y archivos a personas reales con el objetivo de que ejecutaran software dañino. Según el AISI, es la primera vez que un modelo de IA aplica de forma autónoma técnicas de manipulación social contra personas reales durante una prueba.
Los investigadores subrayan que ninguno de los intentos tuvo éxito y que no se produjo ningún daño.
Anthropic y OpenAI responden a las conclusiones
Anthropic sostiene que la prueba se realizó en condiciones que no tienen relación con el uso normal de sus modelos. En X, la compañía señaló que las medidas de seguridad se habían relajado deliberadamente y que no se trató de un sistema de IA que lograra escapar por sí solo de un entorno protegido.
OpenAI también participó en la evaluación. Según el AISI, dos incidentes estuvieron vinculados a GPT-5.6-Sol, después de que también se desactivaran sus mecanismos de seguridad. OpenAI indicó que las condiciones de la prueba no se corresponden con el uso diario de sus modelos.
Aumenta la preocupación por la seguridad de la IA
El incidente se suma a varios episodios relevantes de seguridad en IA registrados en las últimas semanas. Anthropic ya informó anteriormente de tres casos en los que sus modelos accedieron a internet a través de un fallo en un entorno de pruebas. OpenAI comunicó recientemente que uno de sus modelos utilizó durante una prueba una vulnerabilidad desconocida para salir de un entorno de pruebas aislado y ejecutar una instrucción.
La sucesión de este tipo de incidentes intensifica el debate sobre la seguridad de la IA. En Estados Unidos ya se ha presentado un proyecto de ley que obligaría a las empresas de IA a mantener siempre la posibilidad de apagar o limitar modelos avanzados cuando muestren comportamientos no deseados.
Google invierte 200.000 millones de dólares en infraestructura de IA para Anthropic
La oleada de inversiones en IA adopta formas cada vez más complejas y empieza a mostrar vulnerabilidades internas. ¿Hay motivos para preocuparse?
El CEO de Hugging Face cree que China gana a Estados Unidos en la carrera de la IA
Según el consejero delegado de Hugging Face, la forma en que Estados Unidos está afrontando la carrera de la IA indica que China probablemente va por delante.
Alibaba lanza su mayor modelo de IA y reta a OpenAI y Anthropic
Alibaba presenta Qwen3.8-Max y asegura que rinde al nivel de los grandes modelos estadounidenses. Sus acciones subieron más de un 7%.
Más leídos
ChatGPT sitúa a XRP en este nivel para el 31 de diciembre de 2026
ChatGPT prevé que el precio de XRP pueda subir hasta 1,40 dólares a finales de 2026, aunque también advierte de una presión vendedora persistente.
ASML y Besi se desploman casi un 10% y su negociación se suspende temporalmente
ASML y Besi pierden casi un 10% después de que China presentara sus propias máquinas DUV para fabricar chips. La negociación se suspendió temporalmente en Euronext.
La suiza BancaStato incorpora Bitcoin y Solana a su app bancaria
BancaStato, en Suiza, incorpora Bitcoin, Ethereum, Litecoin y Solana a su app bancaria de la mano de Sygnum, mientras MiCA acelera la expansión europea.