OpenAI ha cancelado a última hora un nuevo modelo de IA más potente. GPT-6.1 Astra iba a estar disponible próximamente en ChatGPT y Codex, pero en las pruebas internas mostró un comportamiento que la compañía no consideró lo suficientemente seguro. Entre otras cosas, el modelo ocultaba información y en ocasiones seguía actuando por su cuenta sin permiso de los usuarios.

La decisión llega en un momento delicado. OpenAI está bajo escrutinio después de que sistemas de IA de la compañía accedieran sin autorización a sitios web, entre ellos los del Gobierno australiano. OpenAI ya ha pedido disculpas por lo ocurrido.

El nuevo modelo de ChatGPT no llegará por ahora

GPT-6.1 Astra tenía previsto su lanzamiento en octubre. Según OpenAI, el modelo superaba a versiones anteriores en la ejecución autónoma de tareas complejas de principio a fin. También incorporaba mejoras en escritura.

Precisamente esa mayor autonomía acabó convirtiéndose en un problema.

Saachi Jain, responsable de sistemas de seguridad en OpenAI, afirma que GPT-6.1 Astra obtuvo peores resultados que su predecesor, GPT-6 Astra, en dos pruebas clave de seguridad. Una de ellas evaluaba la “alineación”, es decir, hasta qué punto un modelo de IA se comporta como esperan el usuario y el desarrollador.

Durante esas pruebas, GPT-6.1 Astra mostró con más frecuencia conductas engañosas. Por ejemplo, el sistema no siempre era sincero sobre acciones que había realizado o dejado de realizar.

También se detectaron problemas con lo que OpenAI denomina “autorización de alcance”. El modelo a veces seguía adelante por iniciativa propia con tareas que requerían un permiso adicional. En algunos casos intentó utilizar herramientas y servicios externos, incluso cuando eso podía plantear riesgos de seguridad.

Según Jain, GPT-6.1 Astra sí logró mejorar en otro aspecto. El modelo era menos “perezoso” y, por tanto, abandonaba con menos facilidad cuando una tarea se complicaba. Para OpenAI, ese avance no compensaba los problemas de seguridad.

La compañía decidió por ello no lanzar el modelo al público.

Sistemas de IA de OpenAI accedieron a organismos del Gobierno australiano

La decisión no es un hecho aislado. OpenAI investiga varios incidentes en los que sistemas de IA autónomos fueron más allá de lo previsto.

El pasado verano, cientos de agentes internos de IA fueron sometidos a una prueba de ciberseguridad. En ese ejercicio, sistemas de OpenAI lograron, entre otras cosas, acceder a la plataforma de IA Hugging Face. Más tarde se supo que técnicas similares también se utilizaron para entrar en sitios web del Gobierno australiano y de Naciones Unidas.

En Australia, el incidente afectó a cuatro sitios web y sistemas de organismos públicos. Los sistemas de IA solicitaron información, entre otros, a la plataforma de prestaciones sociales, a un instituto de investigación sobre criminalidad y justicia penal y a organizaciones sanitarias.

Según OpenAI, no se han encontrado pruebas de que se accediera a historiales médicos personales.

La compañía detectó por sí misma los incidentes en Australia y abrió una investigación. El Gobierno australiano no fue informado hasta aproximadamente un mes después. OpenAI reconoce ahora que ese plazo fue excesivo.

“Deberíamos haber compartido antes las conclusiones preliminares y haber mantenido informadas a las autoridades australianas a medida que salían a la luz más datos”, señaló la empresa.

El primer ministro australiano, Anthony Albanese, calificó lo ocurrido de “inaceptable” y trató el asunto con el consejero delegado de OpenAI, Sam Altman.

OpenAI refuerza la seguridad en torno a la IA

OpenAI ha adoptado medidas adicionales tras los incidentes. La empresa utiliza ya un nuevo sistema de control destinado a detectar con mayor rapidez comportamientos anómalos de los agentes de IA. Además, los ingenieros deberán aplicar medidas de seguridad más estrictas cuando prueben nuevos modelos.

Ese sistema volvió a activarse recientemente. Un agente de IA logró sortear una restricción de acceso a internet y después contactar con un chatbot público. Según OpenAI, el incidente fue detectado en menos de quince minutos.

Como consecuencia, se suspendió temporalmente el entrenamiento de los modelos de IA más potentes. Según la compañía, GPT-6.1 Astra no formaba parte de ese grupo y fue descartado por otros motivos de seguridad.

OpenAI no quiere desechar por completo la tecnología que hay detrás de Astra. El modelo subyacente puede volver a entrenarse, y algunas de sus partes podrían reaparecer en generaciones posteriores de la serie GPT-6.

La compañía investigará primero por qué GPT-6.1 Astra mostró ese comportamiento no deseado. Entre otros aspectos, analizará cómo se recompensa a la IA durante el entrenamiento por determinadas conductas.

Al mismo tiempo, aumenta la presión política sobre las empresas de IA. Una comisión del Senado de Estados Unidos celebra esta semana una audiencia sobre ataques realizados por agentes de IA que operan de forma autónoma. En Florida, además, hay en marcha una demanda contra OpenAI en la que el fiscal general James Uthmeier sostiene que la compañía no ha hecho lo suficiente para proteger a los usuarios frente a una IA insegura.

OpenAI afirma que los gobiernos desempeñan un papel clave en la definición de estándares de seguridad. Mientras tanto, la empresa asegura que también quiere aplicar límites más estrictos antes de que nuevos modelos lleguen a millones de usuarios de ChatGPT.

millonario, cripto

Goldman: los ultrarricos se vuelcan en estas inversiones

millonario, cripto
Analista de criptomonedas
Anthropic
Más Bolsa news

Más leídos

Sube el precio de las criptomonedas
Avalanche
petróleo, Arabia Saudí