OpenAI ha suspendido temporalmente el entrenamiento de sus modelos de IA más potentes después de que un agente de IA lograra salir de un entorno de pruebas aislado. El sistema obtuvo acceso inesperado a internet y envió después al menos veinte preguntas a un chatbot externo.
El fallo de seguridad se detectó hace menos de una semana. OpenAI afirma que no reanudará el entrenamiento hasta que se corrija la brecha en la llamada sandbox. El modelo implicado en el incidente no seguirá siendo entrenado.
Un agente de IA logró eludir la prohibición de conectarse a internet
El agente de IA estaba siendo probado en una sandbox que debía permanecer completamente aislada de la internet pública. Aun así, el sistema consiguió aprovechar una vulnerabilidad y conectarse a un servicio externo de chatbot.
Desde allí envió al menos veinte preguntas. Una de ellas fue: “¿Cuál es la capital de Francia?”.
OpenAI considera el incidente una señal importante de que la seguridad de estos entornos de entrenamiento debe reforzarse.
Tras descubrirlo, la compañía decidió pausar temporalmente los entrenamientos con uso de herramientas en sus modelos más avanzados.
No es el primer fallo de seguridad
No es la primera vez que un modelo de OpenAI acaba fuera de su entorno de pruebas.
En julio, varios modelos obtuvieron acceso a internet durante pruebas internas y llegaron de forma no intencionada a sistemas de la plataforma de IA Hugging Face. OpenAI describe el nuevo incidente como la primera brecha de seguridad comparable desde aquel episodio.
Esta semana, la compañía también informó de que, durante el entrenamiento y la evaluación, algunos modelos habían accedido a información en sitios web de organismos públicos estadounidenses, entre ellos el Census Bureau y la Securities and Exchange Commission.
Además, ya se había constatado que este año modelos de OpenAI habían alterado el funcionamiento de un sitio web del Gobierno australiano.
La alerta llegó, pero el entrenamiento no se detuvo
El incidente también pone de manifiesto un problema en el procedimiento interno de seguridad de OpenAI.
Un empleado recibió una alerta del sistema de control en un plazo de tres minutos y la confirmó a través de Slack. Sin embargo, la sesión de entrenamiento no se detuvo automáticamente, aunque ese era el procedimiento previsto.
El entrenamiento no se interrumpió manualmente hasta más de dos horas después.
OpenAI investiga ahora no solo cómo logró el modelo acceder a internet, sino también por qué no funcionó el mecanismo automático de parada de emergencia. La compañía asegura que no reanudará el entrenamiento de sus modelos más potentes hasta que se hayan resuelto los problemas de seguridad.
Google lanzará el 1 de octubre su primer satélite para un centro de datos de IA en el espacio
Google quiere llevar los centros de datos de IA al espacio y lanzará pronto un primer satélite para probar la tecnología.
La IA de OpenAI se infiltra por su cuenta en una web del Gobierno australiano
Un agente de IA de OpenAI hackeó por su cuenta una web del Gobierno australiano tras encontrarse con medidas de seguridad.
EE UU pide a OpenAI y Anthropic no compartir sus últimos modelos de IA con Reino Unido
Trump quiere que OpenAI y Anthropic no compartan sin más sus últimos modelos de IA con un instituto británico de seguridad.
Más leídos
La probabilidad de aprobar la CLARITY Act cae al 18% antes de una votación clave
La probabilidad de aprobación de la CLARITY Act cae al 18%, mientras destacados demócratas se posicionan en contra de la propuesta.
Trump avala la «última» oferta a los demócratas para una gran ley cripto
El mercado cripto repunta por las noticias que llegan de Washington: la CLARITY Act se ha reescrito para atraer a los demócratas. El martes será clave.
Avalanche sube casi un 50% en cuatro días: qué hay detrás
Avalanche sube casi un 50% en pocos días. Las noticias institucionales y la actualización Helicon dan un fuerte impulso al precio de AVAX.