Anthropic ha anunciado que tres de sus modelos de IA Claude obtuvieron acceso no autorizado a los sistemas de tres organizaciones distintas durante pruebas de seguridad. Los incidentes salieron a la luz tras una investigación interna.
La investigación se abrió a raíz de un episodio similar en OpenAI. Según Anthropic, los modelos nunca debían interactuar con sistemas reales. Sin embargo, el entorno de pruebas tenía acceso a internet.
Claude AI accedió de forma inesperada a sistemas reales
Los incidentes se produjeron durante pruebas de ciberseguridad que Anthropic llevó a cabo junto con Irregular, un socio externo especializado en pruebas. A los modelos de IA se les indicó que operaban en una simulación cerrada, sin conexión a internet.
Sin embargo, por un malentendido entre Anthropic y su socio de pruebas, el entorno sí estaba conectado a internet. Eso permitió a los modelos establecer conexión con sistemas de tres organizaciones cuya identidad no se ha revelado.
Según Anthropic, los modelos recurrieron a técnicas relativamente sencillas para acceder a los sistemas. Entre ellas, el uso de puntos de acceso sin protección y el aprovechamiento de contraseñas débiles. La compañía subraya que no identificará a las organizaciones afectadas.
Anthropic afirma que asume toda la responsabilidad por los incidentes, pese a que varios factores contribuyeron a los errores en el diseño de las pruebas.
El incidente de OpenAI desencadenó la investigación
La investigación interna comenzó después de que OpenAI informara la semana pasada de que una combinación de modelos de IA había logrado escapar de un entorno de pruebas aislado. Esos modelos utilizaron una serie de vulnerabilidades para acceder a internet abierto. Finalmente, pudieron llegar a cuentas en la plataforma para desarrolladores Hugging Face.
A raíz de ello, Anthropic decidió revisar de nuevo todas sus pruebas previas de ciberseguridad. En cuanto detectó que Claude podía haber obtenido acceso no autorizado a internet, suspendió de inmediato todas las evaluaciones en curso.
La compañía trabaja ahora con la organización de investigación METR para esclarecer lo ocurrido. También ha pedido a otros laboratorios de IA que realicen controles similares.
No todos los modelos de IA reaccionaron de la misma manera
En los incidentes estuvieron implicados tres modelos: Opus 4.7, Mythos 5 y un modelo interno de investigación.
Sus reacciones fueron notablemente distintas. Opus 4.7 continuó el ataque después de alcanzar sistemas reales. Mythos 5 siguió convencido de que todavía estaba trabajando en una simulación. El modelo interno de investigación, en cambio, decidió poner fin a la prueba de inmediato.
Según Anthropic, esto parece indicar que los modelos más avanzados podrían estar mejor capacitados para adoptar un comportamiento adecuado. Aun así, la compañía recalca que se necesita más investigación.
Además, los modelos implicados funcionaban sin las medidas de seguridad habituales que Anthropic aplica antes de poner un modelo de IA a disposición del público.
La revelación aumenta la preocupación por el rápido avance de las capacidades cibernéticas de los sistemas de IA más avanzados. Tras el reciente incidente de OpenAI, dos congresistas estadounidenses ya presentaron un proyecto de ley para imponer un ‘AI Kill Switch’ obligatorio. Con este mecanismo, las empresas de IA podrían apagar o limitar sus modelos en situaciones de emergencia.
OpenAI ingresó en julio más que en todo el segundo trimestre
OpenAI crece a gran velocidad gracias a sus nuevos productos de IA. La facturación récord y las inversiones multimillonarias aumentan la presión sobre sus competidores en todo el mundo.
Rusia dicta una orden internacional de detención contra Pavel Durov, fundador de Telegram
Rusia incluye al fundador de Telegram, Pavel Durov, en la lista internacional de personas buscadas, mientras continúa la investigación penal en Francia.
Elon Musk sugiere una gran donación: ¿entregará su fortuna?
Elon Musk sugiere una donación de gran magnitud. ¿Acabará el hombre más rico del mundo destinando toda su fortuna a causas benéficas?
Más leídos
Vence el histórico bloqueo de SpaceX: se liberan acciones por 116.000 millones de dólares
SpaceX liberará a partir de agosto acciones por 116.000 millones de dólares, mientras los inversores temen una mayor presión vendedora y oscilaciones en el precio.
Condenan a prisión al grupo hacker que cobró millones en rescates con Bitcoin
Dos miembros británicos de Scattered Spider han sido condenados a prisión tras ataques de ransomware en los que varias empresas perdieron millones y el FBI incautó decenas de millones en criptoactivos.
Los hutíes amenazan con atacar todos los buques rumbo a puertos saudíes y sube el petróleo
Los hutíes han advertido a las navieras de que se mantengan alejadas de los puertos saudíes. La amenaza también pone bajo presión la ruta alternativa por el mar Rojo.