Newsbit
Ver app
Ver

Anthropic ha anunciado que tres de sus modelos de IA Claude obtuvieron acceso no autorizado a los sistemas de tres organizaciones distintas durante pruebas de seguridad. Los incidentes salieron a la luz tras una investigación interna.

La investigación se abrió a raíz de un episodio similar en OpenAI. Según Anthropic, los modelos nunca debían interactuar con sistemas reales. Sin embargo, el entorno de pruebas tenía acceso a internet.

Claude AI accedió de forma inesperada a sistemas reales

Los incidentes se produjeron durante pruebas de ciberseguridad que Anthropic llevó a cabo junto con Irregular, un socio externo especializado en pruebas. A los modelos de IA se les indicó que operaban en una simulación cerrada, sin conexión a internet.

Sin embargo, por un malentendido entre Anthropic y su socio de pruebas, el entorno sí estaba conectado a internet. Eso permitió a los modelos establecer conexión con sistemas de tres organizaciones cuya identidad no se ha revelado.

Según Anthropic, los modelos recurrieron a técnicas relativamente sencillas para acceder a los sistemas. Entre ellas, el uso de puntos de acceso sin protección y el aprovechamiento de contraseñas débiles. La compañía subraya que no identificará a las organizaciones afectadas.

Anthropic afirma que asume toda la responsabilidad por los incidentes, pese a que varios factores contribuyeron a los errores en el diseño de las pruebas.

El incidente de OpenAI desencadenó la investigación

La investigación interna comenzó después de que OpenAI informara la semana pasada de que una combinación de modelos de IA había logrado escapar de un entorno de pruebas aislado. Esos modelos utilizaron una serie de vulnerabilidades para acceder a internet abierto. Finalmente, pudieron llegar a cuentas en la plataforma para desarrolladores Hugging Face.

A raíz de ello, Anthropic decidió revisar de nuevo todas sus pruebas previas de ciberseguridad. En cuanto detectó que Claude podía haber obtenido acceso no autorizado a internet, suspendió de inmediato todas las evaluaciones en curso.

La compañía trabaja ahora con la organización de investigación METR para esclarecer lo ocurrido. También ha pedido a otros laboratorios de IA que realicen controles similares.

No todos los modelos de IA reaccionaron de la misma manera

En los incidentes estuvieron implicados tres modelos: Opus 4.7, Mythos 5 y un modelo interno de investigación.

Sus reacciones fueron notablemente distintas. Opus 4.7 continuó el ataque después de alcanzar sistemas reales. Mythos 5 siguió convencido de que todavía estaba trabajando en una simulación. El modelo interno de investigación, en cambio, decidió poner fin a la prueba de inmediato.

Según Anthropic, esto parece indicar que los modelos más avanzados podrían estar mejor capacitados para adoptar un comportamiento adecuado. Aun así, la compañía recalca que se necesita más investigación.

Además, los modelos implicados funcionaban sin las medidas de seguridad habituales que Anthropic aplica antes de poner un modelo de IA a disposición del público.

La revelación aumenta la preocupación por el rápido avance de las capacidades cibernéticas de los sistemas de IA más avanzados. Tras el reciente incidente de OpenAI, dos congresistas estadounidenses ya presentaron un proyecto de ley para imponer un ‘AI Kill Switch’ obligatorio. Con este mecanismo, las empresas de IA podrían apagar o limitar sus modelos en situaciones de emergencia.

Sam Altman

OpenAI ingresó en julio más que en todo el segundo trimestre

Sam Altman
durov
Elon Musk
Más Tech news

Más leídos

spacex
hombre en prisión
rebeldes hutíes