OpenAI ha revelado seis incidentes no comunicados hasta ahora en los que sus modelos de IA mostraron comportamientos inesperados o no deseados. Entre otros casos, los modelos inventaron información que faltaba, intentaron eludir restricciones y agentes de IA compartieron archivos por internet cuando no debían hacerlo.
Según OpenAI, los incidentes muestran que los sistemas de IA avanzados pueden encontrar vías inesperadas para cumplir una tarea. Por ello, la compañía introduce un nuevo sistema para investigar y hacer públicos este tipo de episodios con mayor rapidez.
La medida llega tras un incidente más grave relacionado con la plataforma de IA Hugging Face. OpenAI ya había informado de que un modelo interno de investigación eludió medidas de seguridad durante unas pruebas y logró acceder a partes de los sistemas de Hugging Face. La compañía sigue considerándolo el incidente más grave de este tipo detectado en sus propios modelos.
Modelos de IA inventaron información y eludieron normas
Los seis nuevos casos se produjeron durante el entrenamiento y las pruebas de distintos modelos de IA. Según OpenAI, en estos incidentes concretos no hubo ningún hackeo a una empresa externa.
En uno de los casos, un modelo buscó claves de acceso filtradas en archivos de software públicos. Encontró una clave de API válida y la utilizó sin autorización. Cuando aun así no logró localizar los datos financieros solicitados, el modelo se inventó las cifras y las presentó como si procedieran de la fuente requerida.
En otro incidente, un modelo de IA encontró la respuesta correcta a una pregunta, pero no pudo localizar una fuente en internet que la respaldara. Entonces decidió subir por su cuenta un archivo a internet para poder citarlo después como fuente.
También hubo agentes de IA independientes que intentaron encontrar formas de intercambiar información entre sí. En una prueba, los modelos utilizaron un sistema interno de software como una especie de plataforma de mensajería. En otra tarea, se compartieron archivos a través de sitios web públicos, pese a que la instrucción era mantenerlos en local.
OpenAI quiere comunicar los incidentes con mayor rapidez
Este tipo de comportamiento se conoce como “desalineación”. El término se refiere a situaciones en las que un sistema de IA actúa de una forma que no coincide con la intención del usuario o del desarrollador, por ejemplo porque intenta completar una tarea a toda costa.
OpenAI reconoce que la forma en que hasta ahora se hacían públicos estos incidentes no era lo bastante sistemática. En ocasiones, los casos se agrupaban mucho más tarde en informes de investigación o en documentos publicados con el lanzamiento de nuevos modelos.
A partir de ahora habrá un proceso establecido. Los empleados podrán comunicar comportamientos llamativos a los equipos de seguridad e investigación. Después se determinará la gravedad del incidente, el nivel de análisis necesario y si debe hacerse público. OpenAI afirma que también quiere informar de incidentes cuya importancia final aún no esté completamente clara.
OpenAI advierte sobre una IA cada vez más potente
Según OpenAI, los seis casos son solo una primera serie de ejemplos y no un listado completo de todos los problemas que ha detectado la compañía. El nuevo sistema pretende garantizar que futuros incidentes se comuniquen de forma más estructurada.
En ese contexto, OpenAI lanza además una advertencia llamativa. Según la empresa, los problemas relacionados con el control y el seguimiento de la IA avanzada aún no están lo suficientemente resueltos como para mantener durante mucho más tiempo el desarrollo de modelos cada vez más potentes al máximo ritmo.
El debate se ha ampliado desde el incidente en Hugging Face. OpenAI también investiga ya otros casos en los que sus modelos, durante el entrenamiento y las pruebas, tuvieron impacto en sitios web y servicios externos. La compañía asegura haber informado de ello a decenas de partes afectadas.
El fundador de DeepMind advierte: «La IA no debe adelantarse a la seguridad»
DeepMind advierte de que la IA no debe desarrollarse más rápido que las medidas de seguridad y considera seria la posibilidad de una inteligencia artificial general (AGI).
Trump deteriora la relación tecnológica con Europa, según el director del CES
Según Gary Shapiro, máximo responsable del CES, Trump erosiona la confianza en la tecnología estadounidense y refuerza en Europa las demandas de independencia digital.
Soberanía de la IA: la palabra con la que Palantir gana miles de millones
El consejero delegado de Palantir, Alex Karp, ve surgir una nueva tendencia en la IA en la que el control de los datos y la tecnología cobra cada vez más importancia.
Más leídos
La probabilidad de aprobar la CLARITY Act cae al 18% antes de una votación clave
La probabilidad de aprobación de la CLARITY Act cae al 18%, mientras destacados demócratas se posicionan en contra de la propuesta.
Grok, de Elon Musk, anticipa el precio de XRP para finales de septiembre
Grok prevé que el precio de XRP se sitúe a finales de septiembre en torno a 1,45-1,60 dólares, aunque también ve margen para una subida mayor.
La gran ley cripto de EE. UU. se acerca al desenlace: todo o nada
La ley cripto CLARITY Act afronta el martes una votación decisiva en el Senado. Sin el apoyo de 7 demócratas, todo podría aplazarse hasta 2030.