Google ha comenzado a desplegar Gemini 4 Argon, su modelo de inteligencia artificial más avanzado y potente. Aunque obtiene buenos resultados en las pruebas oficiales, fuentes citadas por Bloomberg señalan que dentro de la compañía hay dudas sobre su rendimiento en la práctica.
Su rendimiento sería especialmente irregular en las tareas de programación. Google lo niega y sostiene que Gemini 4 está entre los mejores modelos de IA del momento.
Gemini 4 destaca en las pruebas, pero genera dudas en la práctica
Google dio el miércoles acceso inicial a Gemini 4 a un pequeño grupo de socios de confianza del ámbito de la ciberseguridad. Tras nuevas pruebas, el modelo llegará a más usuarios, empezando por los suscriptores de pago.
Según Google, Gemini 4 obtiene resultados muy buenos en varias pruebas de referencia de IA. En una evaluación de capacidades de ciberseguridad, incluso superaría a Astra, de OpenAI.
Sin embargo, varios empleados aseguran que esas cifras no reflejan toda la realidad. Al utilizar Gemini 4 para tareas reales, su rendimiento sería decepcionante en algunos ámbitos.
La programación concentra buena parte de las críticas. El modelo tendría dificultades con determinadas tareas y, según una fuente, también mostraría un rendimiento más débil en el diseño de las interfaces de aplicaciones y páginas web.
Google rechaza esas críticas. Un empleado que participa en el desarrollo afirma que existe un amplio consenso dentro de la compañía sobre que Gemini 4 se sitúa entre los mejores modelos. Según Google, las exhaustivas pruebas internas tampoco muestran dificultades para resolver tareas complejas de programación en situaciones reales.
Las opiniones dentro de la empresa están, por tanto, divididas. Algunos empleados consideran que Anthropic y OpenAI avanzan más rápido y prevén que Gemini 4 quede rezagado en ciertos aspectos. Otros creen que Google ya ha recortado la distancia.
Google no puede permitirse otro revés
Hay mucho en juego. Gemini es la base de las funciones de IA de casi todos los grandes productos de Google, entre ellos su buscador, Gmail, Maps y Chrome. Cada uno de estos servicios supera los mil millones de usuarios.
Al mismo tiempo, OpenAI y Anthropic buscan expandirse más allá de sus modelos de IA. Desarrollan cada vez más aplicaciones propias, incluidos agentes de IA capaces de programar y realizar otras tareas de forma autónoma.
Google tiene dificultades para ganar terreno precisamente en la programación con IA. Por eso, una debilidad de Gemini 4 podría dar más margen a sus competidores para atraer a desarrolladores y empresas a sus plataformas.
A ello se suma un revés anterior. Google tenía previsto lanzar Gemini 3.5 Pro en junio, pero esa versión nunca llegó a publicarse. Según fuentes de Bloomberg, el modelo se descartó porque su desarrollo no cumplió las expectativas internas.
La decisión pudo resultar costosa. Según Bloomberg Intelligence, entrenar un modelo de IA de esta envergadura puede costar hasta 400 millones de dólares. A esa cifra se añaden los salarios de los investigadores especializados en IA.
Los buenos resultados en las pruebas no lo dicen todo
El debate sobre Gemini 4 refleja un problema más amplio del sector de la IA. Las empresas utilizan pruebas de referencia para medir el rendimiento de sus modelos. Clientes y desarrolladores recurren después a esas puntuaciones para compararlos.
Pero una puntuación alta no implica necesariamente que un modelo funcione mejor en la práctica.
En el sector se habla por ello de «benchmaxxing»: optimizar un modelo de IA para determinadas pruebas hasta lograr mejores puntuaciones, sin que esos avances se traduzcan siempre en mejoras igual de claras en las tareas cotidianas.
Según dos fuentes de Bloomberg, este debate también afecta a Gemini 4. Edwin Chen, fundador de la empresa de IA Surge AI, lo compara con un alumno que obtiene una nota excelente en un examen, pero cuya calificación dice poco sobre su capacidad para aplicar esos conocimientos en situaciones reales.
Según personas vinculadas al proyecto, Gemini 4 también tiene fortalezas claras. El modelo manejaría bien la información que va más allá del texto, por ejemplo, al analizar vídeos. También destacaría en ciberseguridad, seguridad y capacidad para comunicarse de forma natural.
Google afirma que Gemini 4 está diseñado para realizar tareas prolongadas y complejas en desarrollo de software, finanzas, derecho y ciberseguridad. Además, puede procesar mucha más información a la vez que su predecesor: hasta un millón de tokens, una cantidad equivalente a unas 750.000 palabras, según la compañía.
Los resultados de Micron despejan las dudas: la demanda de IA sigue disparada
Micron vuelve a superar las expectativas. Ya tiene vendida casi toda su producción de chips de memoria de 2027. La demanda también sigue siendo elevada para 2028.
Palantir supera a Oracle en valor bursátil con una décima parte de sus ingresos
Palantir tiene casi el mismo valor bursátil que Oracle, pese a unos ingresos muy inferiores. Los inversores confían en un fuerte crecimiento impulsado por la inteligencia artificial.
El plan de John Ternus para Apple: más rapidez, menos estructura y más IA
Apple busca acelerar el lanzamiento de productos, reducir niveles directivos, impulsar la IA y abrir nuevas vías de ingresos bajo la dirección de John Ternus, mientras se ralentiza el crecimiento de los servicios.
Más leídos
Quant se dispara un 74% en un día: por qué sube
Quant sube un 74% en un día y un 172% en una semana, impulsada por nuevas alianzas con grandes bancos.
Un analista de Wall Street prevé que Quant alcance los 10.000 dólares
El analista de Wall Street Jan Nieuwenhuijs prevé que la cotización de Quant pueda subir hasta los 10.000 dólares, casi un 4.000% por encima de su nivel actual.
Avalanche sube casi un 50% en cuatro días: qué hay detrás
Avalanche sube casi un 50% en pocos días. Las noticias institucionales y la actualización Helicon dan un fuerte impulso al precio de AVAX.