Gemini 4 Pro podría haber aparecido disfrazado en el benchmark de Google

Rene Fraga
11 minutos de lectura

Principales destacados

  • Apareció un modelo misterioso: desarrolladores identificaron en Arena un modelo llamado “gemini-3.8-flash” que podría ser un checkpoint de Gemini 4 Pro.
  • Los números llamaron la atención: los resultados atribuidos al modelo superan, en las pruebas divulgadas, a competidores en programación, razonamiento computacional y tareas con agentes.
  • Google guarda silencio: la empresa confirmó que está entrenando Gemini 4, pero no ha revelado oficialmente variantes, especificaciones ni fecha de lanzamiento.

El nombre parece familiar. Quizás demasiado familiar 👀

Google podría estar probando su próximo gran modelo de inteligencia artificial incluso antes de presentarlo al público.

Desde el 17 de septiembre, desarrolladores comenzaron a informar sobre la presencia de un modelo sospechoso en la plataforma de benchmark Arena. El sistema aparece con el nombre “gemini-3.8-flash”, pero sus características y los resultados atribuidos a él han planteado la hipótesis de que, en realidad, se trate de un modelo relacionado con el futuro Gemini 4 Pro.

El posible nombre en clave interno sería Argon.

Nada de esto ha sido confirmado oficialmente por Google. Y esa es precisamente la parte interesante: el nombre mostrado en la plataforma coincide con un modelo real que la compañía ya lanzó, pero los números atribuidos al misterioso sistema parecen pertenecer a una categoría muy diferente.

🔎 La pista principal: el rendimiento divulgado no parece coincidir con el Gemini 3.8 Flash de producción.

¿Y los benchmarks? Ahí la historia se pone más seria 📊

Según datos filtrados compartidos por desarrolladores que probaron el modelo en Arena, el sistema habría alcanzado resultados destacados en diferentes evaluaciones.

BenchmarkResultado atribuido al modelo
DeepSWE v1.188%
Terminal-bench 2.195,3%
OSWorld-2.086,8%

Las pruebas cubren áreas diferentes. DeepSWE evalúa tareas de programación con agentes de IA, mientras que Terminal-bench mide capacidades de codificación. OSWorld, por su parte, examina la capacidad del modelo para realizar tareas en entornos informáticos.

Según los informes, el supuesto Gemini 4 Pro habría superado tanto a GPT-6 Astra, de OpenAI, como a Claude Fable 5.1, de Anthropic, en estas pruebas.

Hay una salvedad importante: los resultados proceden de información filtrada y de informes de desarrolladores, no de una divulgación oficial de Google.

💡 Si estos números se confirman, el detalle más importante no será el nombre oculto, sino el salto de capacidad que sugieren.

Diez millones de tokens no son precisamente poca cosa 🧠

Además de los benchmarks, las especificaciones atribuidas al modelo también llaman la atención.

El sistema tendría:

10 millones de tokens de entrada, lo que permitiría trabajar con enormes volúmenes de contexto;

256.000 tokens de salida, una capacidad igualmente inusual para generaciones prolongadas;

memoria persistente, manteniendo información entre diferentes sesiones.

En la práctica, esto apunta a un modelo pensado no solo para responder preguntas, sino también para sostener trabajos largos y complejos.

Y hay otro detalle curioso.

También parece gustarle construir cosas 🎨

Desarrolladores que tuvieron contacto con el modelo informaron de un rendimiento particularmente sólido en la generación de SVG y contenido 3D.

Uno de los informes afirma que fue posible crear un sitio web completo de portafolio creativo en apenas 14 minutos.

Otros usuarios dijeron que el sistema puede generar juegos interactivos completos a partir de un solo prompt.

Estos informes todavía deben tratarse como experiencias individuales, no como una medición independiente del rendimiento. Pero ayudan a explicar por qué el supuesto modelo llamó tanto la atención entre quienes siguen las pruebas anticipadas de IA.

¿Y cuánto costaría este monstruo? 💸

Curiosamente, la posible estrategia de Google no parece implicar un precio premium.

Los valores reportados serían de:

US$ 2,25 por millón de tokens de entrada

US$ 11,25 por millón de tokens de salida

Si estas cifras realmente corresponden al modelo en cuestión, lo situarían en una posición agresiva entre los grandes modelos de frontera.

Pero existe una diferencia importante entre un precio atribuido en una plataforma de pruebas y el precio oficial de una API. Hasta que Google publique especificaciones comerciales, estos valores deben considerarse provisionales.

Google llegó hasta aquí después de cambiar de rumbo 🔄

La posible aparición de Gemini 4 ocurre después de una secuencia inusual de movimientos dentro de la división de IA de Google.

A finales de agosto, el Wall Street Journal informó que Gemini 3.5 Pro habría sido descartado porque los candidatos internos no ofrecían una ventaja suficientemente grande sobre la línea Flash.

Mientras tanto, Google habría lanzado cuatro modelos Flash consecutivos desde mayo, culminando con Gemini 3.8 Flash, presentado el 2 de septiembre.

La diferencia entre ambas historias es precisamente lo que alimentó la especulación actual.

🧩 La coincidencia es difícil de ignorar: un modelo llamado Gemini 3.8 Flash aparece en Arena, pero con especificaciones y resultados que los desarrolladores asocian con una generación futura.

Gemini 4 ya estaba oficialmente en entrenamiento

Aunque Google no ha confirmado el modelo de Arena, Gemini 4 en sí no es un rumor.

El 21 de julio, Google DeepMind afirmó que había iniciado “nuestro entrenamiento previo más ambicioso hasta ahora, para Gemini 4”.

Al día siguiente, Sundar Pichai volvió a mencionar el proyecto durante la conferencia sobre los resultados del segundo trimestre de Alphabet.

Lo que la empresa no ha revelado es mucho más específico: no existe confirmación pública de una variante llamada Gemini 4 Pro, ni de sus especificaciones, precio o calendario de lanzamiento.

Y eso deja bastante espacio para las interpretaciones.

Entonces, ¿por qué ocultar un modelo detrás de otro nombre? 🕵️

La hipótesis que circula entre los desarrolladores es relativamente sencilla: utilizar el nombre de un modelo ya existente permitiría evaluar un sistema nuevo en condiciones reales sin anunciar de antemano su identidad.

En ese escenario, el “gemini-3.8-flash” visto en Arena sería una especie de disfraz para un modelo experimental.

Pero existe otra posibilidad más prosaica: el nombre podría simplemente representar una configuración, checkpoint o variante que no corresponde a Gemini 4 Pro.

Sin confirmación de Google, no es posible separar definitivamente estas hipótesis.

Octubre aparece en el radar, pero sigue siendo especulación 📅

Estimaciones de la comunidad apuntan a un posible lanzamiento público de Gemini 4 alrededor de octubre de 2026.

Hasta ahora, sin embargo, no existe una fecha oficial anunciada por Google.

Tampoco hay confirmación pública de que el modelo probado en Arena sea el mismo sistema que llegará a consumidores, desarrolladores o empresas.

La comparación resulta aún más curiosa cuando se observa el Gemini 3.8 Flash oficial. El modelo lanzado el 2 de septiembre tendría una ventana de contexto de 1 millón de tokens y un precio de US$ 0,75 por millón de tokens de entrada.

El supuesto modelo de Arena, por otro lado, tendría 10 millones de tokens de entrada y un precio considerablemente mayor.

Son diferencias demasiado grandes para ignorarlas, pero todavía no lo suficientemente grandes como para demostrar la identidad del sistema.

Y hay una pieza todavía más ambiciosa en esta historia 🤖

En un evento reciente en Berkeley, Jasjeet Sekhon, director de estrategia de Google DeepMind, afirmó que el auto-mejoramiento recursivo se convirtió en “un componente clave de la justificación detrás de las enormes inversiones en IA”.

La declaración cobró atención porque surgieron afirmaciones no verificadas de que el preentrenamiento de Gemini 4 se habría beneficiado de un ciclo cerrado de RSI, o recursive self-improvement.

Este punto, sin embargo, se encuentra en un terreno todavía más especulativo. La existencia de investigaciones sobre auto-mejoramiento no demuestra que el supuesto modelo de Arena haya sido entrenado de esa manera.

Por ahora, hay dos historias diferentes ocurriendo al mismo tiempo: una confirmada, sobre el entrenamiento de Gemini 4, y otra todavía no confirmada, sobre la identidad del misterioso modelo del benchmark.

La verdadera prueba todavía está por llegar 🚦

Si el “gemini-3.8-flash” de Arena es realmente una prueba anticipada de Gemini 4 Pro, Google podría estar preparando una presentación muy diferente de la secuencia de lanzamientos Flash que marcó los últimos meses.

Y los números filtrados generan una expectativa específica: no solo un modelo más grande, sino un sistema capaz de combinar programación, agentes, uso del ordenador, un contexto gigantesco y generación multimedia en una misma plataforma.

Por ahora, sin embargo, el nombre sigue siendo solo un nombre.

El próximo paso que podría transformar la especulación en un hecho es sencillo: que Google revele oficialmente qué había detrás de aquel “gemini-3.8-flash”.

Hasta entonces, el supuesto Gemini 4 Pro seguirá circulando como un coche de pruebas con la matrícula de otro modelo.

Seguir
Renê Fraga es fundador de Google Discovery y editor en jefe de Eurisko, un ecosistema editorial independiente dedicado a la tecnología, la ciencia y la innovación. Profesional del marketing digital, con posgrado por la ESPM, sigue de cerca a Google desde la década de 2000 y escribe desde hace más de 20 años sobre tecnología, productos digitales e inteligencia artificial. Fundó Google Discovery en 2006, convirtiéndolo en uno de los principales sitios especializados en Google en Brasil, y fue columnista de TechTudo (Globo.com).
No hay comentarios