Google ha comenzado a desplegar Gemini 4 Argon, su modelo de inteligencia artificial más avanzado y potente. Aunque obtiene buenos resultados en las pruebas oficiales, fuentes citadas por Bloomberg señalan que dentro de la compañía hay dudas sobre su rendimiento en la práctica.

Su rendimiento sería especialmente irregular en las tareas de programación. Google lo niega y sostiene que Gemini 4 está entre los mejores modelos de IA del momento.

Gemini 4 destaca en las pruebas, pero genera dudas en la práctica

Google dio el miércoles acceso inicial a Gemini 4 a un pequeño grupo de socios de confianza del ámbito de la ciberseguridad. Tras nuevas pruebas, el modelo llegará a más usuarios, empezando por los suscriptores de pago.

Según Google, Gemini 4 obtiene resultados muy buenos en varias pruebas de referencia de IA. En una evaluación de capacidades de ciberseguridad, incluso superaría a Astra, de OpenAI.

Sin embargo, varios empleados aseguran que esas cifras no reflejan toda la realidad. Al utilizar Gemini 4 para tareas reales, su rendimiento sería decepcionante en algunos ámbitos.

La programación concentra buena parte de las críticas. El modelo tendría dificultades con determinadas tareas y, según una fuente, también mostraría un rendimiento más débil en el diseño de las interfaces de aplicaciones y páginas web.

Google rechaza esas críticas. Un empleado que participa en el desarrollo afirma que existe un amplio consenso dentro de la compañía sobre que Gemini 4 se sitúa entre los mejores modelos. Según Google, las exhaustivas pruebas internas tampoco muestran dificultades para resolver tareas complejas de programación en situaciones reales.

Las opiniones dentro de la empresa están, por tanto, divididas. Algunos empleados consideran que Anthropic y OpenAI avanzan más rápido y prevén que Gemini 4 quede rezagado en ciertos aspectos. Otros creen que Google ya ha recortado la distancia.

Google no puede permitirse otro revés

Hay mucho en juego. Gemini es la base de las funciones de IA de casi todos los grandes productos de Google, entre ellos su buscador, Gmail, Maps y Chrome. Cada uno de estos servicios supera los mil millones de usuarios.

Al mismo tiempo, OpenAI y Anthropic buscan expandirse más allá de sus modelos de IA. Desarrollan cada vez más aplicaciones propias, incluidos agentes de IA capaces de programar y realizar otras tareas de forma autónoma.

Google tiene dificultades para ganar terreno precisamente en la programación con IA. Por eso, una debilidad de Gemini 4 podría dar más margen a sus competidores para atraer a desarrolladores y empresas a sus plataformas.

A ello se suma un revés anterior. Google tenía previsto lanzar Gemini 3.5 Pro en junio, pero esa versión nunca llegó a publicarse. Según fuentes de Bloomberg, el modelo se descartó porque su desarrollo no cumplió las expectativas internas.

La decisión pudo resultar costosa. Según Bloomberg Intelligence, entrenar un modelo de IA de esta envergadura puede costar hasta 400 millones de dólares. A esa cifra se añaden los salarios de los investigadores especializados en IA.

Los buenos resultados en las pruebas no lo dicen todo

El debate sobre Gemini 4 refleja un problema más amplio del sector de la IA. Las empresas utilizan pruebas de referencia para medir el rendimiento de sus modelos. Clientes y desarrolladores recurren después a esas puntuaciones para compararlos.

Pero una puntuación alta no implica necesariamente que un modelo funcione mejor en la práctica.

En el sector se habla por ello de «benchmaxxing»: optimizar un modelo de IA para determinadas pruebas hasta lograr mejores puntuaciones, sin que esos avances se traduzcan siempre en mejoras igual de claras en las tareas cotidianas.

Según dos fuentes de Bloomberg, este debate también afecta a Gemini 4. Edwin Chen, fundador de la empresa de IA Surge AI, lo compara con un alumno que obtiene una nota excelente en un examen, pero cuya calificación dice poco sobre su capacidad para aplicar esos conocimientos en situaciones reales.

Según personas vinculadas al proyecto, Gemini 4 también tiene fortalezas claras. El modelo manejaría bien la información que va más allá del texto, por ejemplo, al analizar vídeos. También destacaría en ciberseguridad, seguridad y capacidad para comunicarse de forma natural.

Google afirma que Gemini 4 está diseñado para realizar tareas prolongadas y complejas en desarrollo de software, finanzas, derecho y ciberseguridad. Además, puede procesar mucha más información a la vez que su predecesor: hasta un millón de tokens, una cantidad equivalente a unas 750.000 palabras, según la compañía.

micron

Los resultados de Micron despejan las dudas: la demanda de IA sigue disparada

micron
palantir
consejero delegado de Apple
Más Bolsa news

Más leídos

Sube el precio de las criptomonedas
toro de Wall Street
Avalanche