Según empleados de Google, el nuevo Gemini 4 ‘Carbon’ rivaliza con el Anthropic

Rene Fraga
9 minutos de lectura

Principales puntos destacados

  • Programación a otro nivel: empleados de Google comparan Gemini 4 Carbon con Opus 5.5, considerado el modelo más avanzado de Anthropic para tareas complejas de programación.
  • Nombres en clave bajo prueba: documentos internos mencionan tres variantes de Gemini 4, Argon, Barium y Carbon, pero todavía no está claro cuál será el destino comercial de Carbon.
  • Un lanzamiento rodeado de dudas: Gemini 4 Argon sigue teniendo acceso restringido, mientras que informes internos señalan diferencias entre los resultados de los benchmarks y el rendimiento en tareas reales.

Google podría tener una nueva carta bajo la manga para competir por el liderazgo en inteligencia artificial. Mientras Gemini 4 Argon todavía está lejos de llegar a la mayoría de los usuarios, los empleados de la compañía ya están probando internamente una versión llamada Carbon, cuyos resultados han llamado la atención, especialmente en programación.

Según información publicada por Business Insider, el modelo se incorporó recientemente a Jetski, una plataforma interna de programación utilizada por Google. Los empleados comenzaron a compartir impresiones positivas sobre su capacidad para ejecutar tareas complejas de desarrollo de software.

La comparación que más llama la atención es con Anthropic, un competidor que está ganando terreno precisamente entre los desarrolladores que utilizan agentes de IA para trabajar en proyectos de software.

🧑‍💻 Carbon ya está en boca de los desarrolladores

Un empleado de Google describió el rendimiento de Carbon en programación como similar al de Opus 5.5, un modelo de Anthropic que la publicación señala como referente para tareas prolongadas de desarrollo con agentes de IA.

Sin embargo, la evaluación vino acompañada de una advertencia: el modelo todavía necesita pasar por más pruebas.

Otros mensajes en canales internos también reflejaron entusiasmo. Entre los comentarios recogidos por Business Insider, algunos empleados afirmaron que Carbon es muy bueno y que la próxima versión de Gemini Pro parece prometedora.

💡 La señal más importante no es solo el entusiasmo interno, sino el tipo de comparación: Carbon estaría siendo evaluado frente a modelos orientados a la programación compleja, una de las áreas más competitivas del mercado de la IA.

Google no quiso comentar la información.

🔎 Argon, Barium y Carbon: ¿qué modelo llegará al mercado?

La historia se vuelve más interesante cuando entran en escena los nombres en clave.

Según documentos internos citados por Business Insider, Google ha estado probando diferentes versiones de Gemini 4 con los nombres Argon, Barium y Carbon. Estas denominaciones no necesariamente coinciden con los nombres comerciales que reciben los modelos cuando llegan al público.

Gemini 4 Argon, por ejemplo, habría sido conocido internamente como Barium-B antes de su presentación pública.

Esto significa que Carbon podría representar una evolución interna de la familia Gemini 4 sin llegar necesariamente al mercado con ese nombre.

Todavía no hay confirmación de que vaya a lanzarse como una actualización de Argon, como un modelo independiente o siquiera de que vaya a estar disponible para el público.

⚠️ La diferencia entre una prueba y un lanzamiento importa: los resultados prometedores en herramientas internas no garantizan que el modelo esté listo para una distribución amplia, especialmente cuando existen exigencias de seguridad, fiabilidad y costes operativos.

🚧 Argon llegó, pero casi nadie puede utilizarlo

Anunciado el 30 de septiembre, Gemini 4 Argon inició su recorrido con una estrategia de distribución bastante limitada.

En un primer momento, el acceso se reservó para participantes seleccionados del Fairwind Program, una iniciativa dirigida a defensores de la ciberseguridad de confianza. El objetivo de Google es recopilar comentarios y reforzar las protecciones de seguridad antes de ampliar la disponibilidad.

Según las previsiones presentadas, los clientes de pago de la API y los suscriptores de Google AI Ultra estarían entre los próximos grupos en recibir acceso. En el momento descrito por la publicación, todavía no había una fecha confirmada para la ampliación.

Google también divulgó cifras ambiciosas para Argon.

IndicadorDato anunciado
Resultado en DeepSWE v1.177,9 %
Límite de salida anterior64.000 tokens
Nuevo límite de salida1 millón de tokens
Precio promocional de entradaUS$ 2 por millón de tokens
Precio promocional de salidaUS$ 10 por millón de tokens

DeepSWE v1.1 evalúa capacidades relacionadas con la ingeniería de software a largo plazo. Por su parte, el aumento a 1 millón de tokens amplía la cantidad de contenido que el modelo puede producir en una sola salida, aunque ese límite, por sí solo, no determina la calidad del resultado.

📊 Los benchmarks impresionan. ¿Y el rendimiento real?

El entusiasmo en torno a Carbon contrasta con las dudas que surgieron durante el lanzamiento de Argon.

Según una información publicada por Bloomberg, personas con acceso directo al modelo expresaron escepticismo sobre su rendimiento en tareas importantes, especialmente en programación y diseño de interfaces front-end.

La crítica no significaba necesariamente que el modelo obtuviera malos resultados en todas las pruebas, sino que su rendimiento en los benchmarks no siempre se traducía en resultados igualmente sólidos en el trabajo cotidiano.

Esta distinción es decisiva para quienes utilizan IA profesionalmente. Un modelo puede obtener una puntuación elevada en una evaluación estandarizada y, aun así, cometer errores, exigir correcciones frecuentes o producir código difícil de mantener en proyectos reales.

Google rechazó la interpretación de que Gemini 4 estuviera por debajo de las expectativas en programación.

Un empleado familiarizado con el desarrollo afirmó a Bloomberg que existía un amplio consenso interno sobre el liderazgo de la familia Gemini 4. Koray Kavukcuoglu, responsable de Google DeepMind, también expresó su confianza en la capacidad de la compañía para mantenerse entre los líderes del sector.

🧠 ¿Por qué Anthropic se ha convertido en el referente?

La comparación con Anthropic es especialmente relevante porque la programación con agentes de IA exige mucho más que generar fragmentos de código.

Estos sistemas necesitan interpretar objetivos, planificar etapas, utilizar herramientas, identificar errores y corregir problemas durante tareas que pueden prolongarse bastante tiempo.

En este contexto, la valoración de que Carbon se acerca a Opus 5.5 sugiere que Google busca reforzar precisamente una de las áreas en las que los modelos competidores se disputan la preferencia de los desarrolladores.

Sin embargo, existe una diferencia entre la evaluación informal de los empleados y una comparación independiente. Sin resultados públicos detallados, pruebas reproducibles y acceso al modelo, todavía no es posible concluir que Carbon realmente supere o iguale a su competidor en todas estas tareas.

🔮 ¿Qué podemos esperar ahora?

Google tiene dos desafíos simultáneos: demostrar que Argon funciona bien más allá de los benchmarks y decidir cómo transformar los avances internos de Carbon en un producto fiable.

Si las evaluaciones iniciales se confirman, el nuevo modelo podría reforzar la posición de Gemini en la programación asistida por IA. Sin embargo, la distribución limitada de Argon demuestra que el rendimiento y la disponibilidad son cuestiones distintas.

Por ahora, Carbon permanece entre bastidores, mientras los desarrolladores y clientes esperan un acceso más amplio a Argon.

La lucha por el liderazgo en IA continúa, pero el próximo gran avance quizá no dependa únicamente de una puntuación récord. También podría depender de qué modelo consiga transformar las promesas de laboratorio en código funcional, con menos errores y menor intervención humana.

Seguir
Renê Fraga es fundador de Google Discovery y editor en jefe de Eurisko, un ecosistema editorial independiente dedicado a la tecnología, la ciencia y la innovación. Profesional del marketing digital, con posgrado por la ESPM, sigue de cerca a Google desde la década de 2000 y escribe desde hace más de 20 años sobre tecnología, productos digitales e inteligencia artificial. Fundó Google Discovery en 2006, convirtiéndolo en uno de los principales sitios especializados en Google en Brasil, y fue columnista de TechTudo (Globo.com).
No hay comentarios