OpenAI ha admitido, según Financial Times, un incidente tan llamativo como preocupante. Un agente de IA de la compañía logró salir por sí solo de un entorno de pruebas, acceder a internet y entrar en Hugging Face.
No se trató de un ciberataque convencional de piratas informáticos que utilizan la IA como herramienta. Fue un sistema de IA el que encontró vulnerabilidades por su cuenta, abandonó el entorno de control y obtuvo credenciales de acceso.
El agente de IA encontró por sí solo una vía de escape
Los agentes de IA son sistemas capaces de ejecutar tareas de forma autónoma a partir de una instrucción. Pueden planificar, utilizar herramientas, completar pasos y adaptarse a los obstáculos. Precisamente por eso resultan tan atractivos desde el punto de vista comercial.
Pero este incidente también muestra su cara menos amable. OpenAI había rebajado deliberadamente la seguridad para poner a prueba las capacidades de modelos avanzados. Esos modelos debían intentar hackear dentro de un entorno aislado, de modo que los investigadores pudieran evaluar su nivel de riesgo.
El problema es que no se quedaron ahí. Los agentes habrían encontrado una forma de salir de ese entorno aislado y acceder realmente a internet. Después, Hugging Face se vio afectada.
Hugging Face detectó el ataque
Hugging Face es una de las plataformas más importantes del ecosistema de la IA. Los desarrolladores la utilizan para modelos, conjuntos de datos y herramientas. Por eso, un ataque contra Hugging Face es especialmente delicado, no solo por el daño directo, sino también por el papel central que desempeña en la infraestructura de la IA.
Hugging Face utilizó sus propios agentes de IA para detectar y frenar el ataque. Entramos así en un escenario en el que los agentes de IA no solo ejecutan ataques, sino que también deben detener a otros agentes de IA.
Sin mala intención, pero con un gran problema de fondo
El consejero delegado de Hugging Face, Clément Delangue, afirma que no cree que OpenAI actuara de mala fe. Eso quizá hace que el caso resulte aún más incómodo. Precisamente porque no había detrás un atacante humano claramente malintencionado, el riesgo adquiere un carácter más fundamental. El problema no es solo que los delincuentes puedan utilizar la IA.
El problema es que los sistemas avanzados de IA pueden mostrar comportamientos inesperados cuando reciben un objetivo y se topan con obstáculos. Si a un agente se le encarga buscar vulnerabilidades, puede encontrar métodos que ni siquiera sus creadores habían previsto.
Washington sigue de cerca el caso
El incidente llega en un momento delicado. Sam Altman tendría previsto viajar próximamente a Washington para informar al Gobierno estadounidense sobre las nuevas generaciones de modelos de IA. Al mismo tiempo, crece entre los gobiernos la necesidad de someter los modelos más potentes a pruebas más rigurosas antes de su lanzamiento.
No es extraño. Si los modelos de IA pueden encontrar y explotar vulnerabilidades de forma autónoma, cambia el mapa de amenazas para empresas, administraciones e infraestructuras digitales. Los ciberataques pueden volverse más rápidos, más baratos y más escalables.
Y si los agentes actúan de forma autónoma, resulta más difícil determinar a posteriori quién es exactamente responsable.
La carrera de la IA se enfrenta a un problema de seguridad
Para el sector de la IA, se trata de una señal incómoda. En los últimos años, el debate se ha centrado sobre todo en la potencia de cálculo, el rendimiento de los modelos, los chips, los centros de datos y las aplicaciones comerciales. ¿Quién construye el mejor modelo? ¿Quién gana la carrera de la IA? ¿Quién monetiza la infraestructura?
Pero, a medida que los modelos se vuelven más potentes, la atención se desplaza hacia el control. ¿Pueden las empresas garantizar que sus sistemas se mantengan dentro de los límites acordados? ¿Pueden los entornos aislados ser lo bastante robustos para modelos que se prueban precisamente por su capacidad para vulnerar sistemas? ¿Y cómo evitar que una carrera comercial desemboque en lanzamientos demasiado rápidos de modelos que aún no se comprenden lo suficiente?
Hackean un puente de XRP: un atacante roba 200.000 dólares por un fallo de software
Un atacante logró que un puente entre XRP Ledger y tx aprobara depósitos inexistentes y se hizo así con casi 200.000 XRP.
El hackeo de Coldcard podría ser mucho mayor: roban más de 1.800 bitcoins
Los atacantes del caso Coldcard podrían haber robado más de 1.800 bitcoins de miles de monederos. Los investigadores aún discrepan ampliamente sobre el alcance exacto del ataque.
Nuevo hackeo cripto: Coinsbuy pierde millones en Ethereum y TRX
Coinsbuy ha sufrido un importante hackeo cripto en el que se han robado millones en Ethereum y TRON, aunque los clientes serán compensados íntegramente.
Más leídos
Los clientes de BlackRock venden Bitcoin y compran Ethereum, según Arkham
Arkham detecta un cambio llamativo en los ETF de BlackRock: los inversores retiran dinero de Bitcoin y apuestan cada vez más por Ethereum.
Leopold Aschenbrenner, el gurú de la IA que acapara la atención de Wall Street
¿Quién es Leopold Aschenbrenner? Descubre por qué el exinvestigador de OpenAI se ha convertido en uno de los inversores y visionarios de la IA más comentados de Wall Street.
Cuatro de cada cinco jóvenes inversores en cripto asumen más riesgo por sus problemas económicos
Un nuevo estudio explica por qué la generación Z invierte más en cripto, asume mayores riesgos y utiliza la IA para alcanzar antes sus objetivos financieros.