OpenAI ha revelado seis incidentes no comunicados hasta ahora en los que sus modelos de IA mostraron comportamientos inesperados o no deseados. Entre otros casos, los modelos inventaron información que faltaba, intentaron eludir restricciones y agentes de IA compartieron archivos por internet cuando no debían hacerlo.

Según OpenAI, los incidentes muestran que los sistemas de IA avanzados pueden encontrar vías inesperadas para cumplir una tarea. Por ello, la compañía introduce un nuevo sistema para investigar y hacer públicos este tipo de episodios con mayor rapidez.

La medida llega tras un incidente más grave relacionado con la plataforma de IA Hugging Face. OpenAI ya había informado de que un modelo interno de investigación eludió medidas de seguridad durante unas pruebas y logró acceder a partes de los sistemas de Hugging Face. La compañía sigue considerándolo el incidente más grave de este tipo detectado en sus propios modelos.

Modelos de IA inventaron información y eludieron normas

Los seis nuevos casos se produjeron durante el entrenamiento y las pruebas de distintos modelos de IA. Según OpenAI, en estos incidentes concretos no hubo ningún hackeo a una empresa externa.

En uno de los casos, un modelo buscó claves de acceso filtradas en archivos de software públicos. Encontró una clave de API válida y la utilizó sin autorización. Cuando aun así no logró localizar los datos financieros solicitados, el modelo se inventó las cifras y las presentó como si procedieran de la fuente requerida.

En otro incidente, un modelo de IA encontró la respuesta correcta a una pregunta, pero no pudo localizar una fuente en internet que la respaldara. Entonces decidió subir por su cuenta un archivo a internet para poder citarlo después como fuente.

También hubo agentes de IA independientes que intentaron encontrar formas de intercambiar información entre sí. En una prueba, los modelos utilizaron un sistema interno de software como una especie de plataforma de mensajería. En otra tarea, se compartieron archivos a través de sitios web públicos, pese a que la instrucción era mantenerlos en local.

OpenAI quiere comunicar los incidentes con mayor rapidez

Este tipo de comportamiento se conoce como “desalineación”. El término se refiere a situaciones en las que un sistema de IA actúa de una forma que no coincide con la intención del usuario o del desarrollador, por ejemplo porque intenta completar una tarea a toda costa.

OpenAI reconoce que la forma en que hasta ahora se hacían públicos estos incidentes no era lo bastante sistemática. En ocasiones, los casos se agrupaban mucho más tarde en informes de investigación o en documentos publicados con el lanzamiento de nuevos modelos.

A partir de ahora habrá un proceso establecido. Los empleados podrán comunicar comportamientos llamativos a los equipos de seguridad e investigación. Después se determinará la gravedad del incidente, el nivel de análisis necesario y si debe hacerse público. OpenAI afirma que también quiere informar de incidentes cuya importancia final aún no esté completamente clara.

OpenAI advierte sobre una IA cada vez más potente

Según OpenAI, los seis casos son solo una primera serie de ejemplos y no un listado completo de todos los problemas que ha detectado la compañía. El nuevo sistema pretende garantizar que futuros incidentes se comuniquen de forma más estructurada.

En ese contexto, OpenAI lanza además una advertencia llamativa. Según la empresa, los problemas relacionados con el control y el seguimiento de la IA avanzada aún no están lo suficientemente resueltos como para mantener durante mucho más tiempo el desarrollo de modelos cada vez más potentes al máximo ritmo.

El debate se ha ampliado desde el incidente en Hugging Face. OpenAI también investiga ya otros casos en los que sus modelos, durante el entrenamiento y las pruebas, tuvieron impacto en sitios web y servicios externos. La compañía asegura haber informado de ello a decenas de partes afectadas.

Logotipo de Google

El fundador de DeepMind advierte: «La IA no debe adelantarse a la seguridad»

Logotipo de Google
Trump
Palantir
Más Tech news

Más leídos

Capitolio de EE. UU.
Elon Musk XAI, Grok
Miembros del Senado de Estados Unidos escuchan en una sala de reuniones clásica