Google DeepMind lanza Gemini Robotics 2 para robots humanoides

Rene Fraga
9 minutos de lectura

Principales destacados

  • Google DeepMind ha presentado Gemini Robotics 2, una nueva generación de IA capaz de controlar todo el cuerpo de robots humanoides.
  • La plataforma reúne tres modelos especializados en movimiento, razonamiento y operación local, lo que permite tareas más complejas y la colaboración entre distintos robots.
  • El lanzamiento refuerza la estrategia de Google de llevar Gemini más allá de los teléfonos y ordenadores, haciendo que su inteligencia artificial actúe directamente en el mundo físico.

Google DeepMind ha dado un paso importante en la evolución de la inteligencia artificial aplicada a la robótica al anunciar Gemini Robotics 2, su nueva plataforma para robots humanoides.

La actualización representa una evolución significativa respecto al primer Gemini Robotics, lanzado en 2025, y amplía las capacidades de la IA para controlar prácticamente todos los movimientos del cuerpo de un robot, desde la cabeza hasta los pies.

En la práctica, esto significa que los robots dejan de ejecutar solo movimientos aislados de los brazos para realizar actividades completas, que incluyen caminar, mantener el equilibrio, agacharse, alcanzar objetos a diferentes alturas y manipular elementos delicados.

La novedad se considera uno de los avances más importantes recientes de Google en el área de la robótica y forma parte de la estrategia de la empresa de expandir el alcance de Gemini más allá de los entornos digitales.

Durante las demostraciones presentadas por Google DeepMind, el robot humanoide Apollo 2, desarrollado por Apptronik, recibió instrucciones en lenguaje natural y logró interpretar el entorno, caminar hasta una mesa, localizar una regadera y colocarla correctamente en una estantería inferior.

Todo el proceso se ejecutó sin necesidad de programar cada movimiento de forma individual, mostrando una capacidad de planificación mucho más cercana a la forma en que los humanos realizan tareas cotidianas.

Qué cambia respecto a la primera generación de Gemini Robotics

Cuando Google presentó Gemini Robotics por primera vez, el enfoque estaba principalmente en el control de los brazos y las manos del robot.

La nueva generación amplía este concepto hacia el llamado control corporal completo, permitiendo que la inteligencia artificial coordine simultáneamente la locomoción, el equilibrio, la visión por computadora, la manipulación de objetos y la toma de decisiones.

Según Google DeepMind, este avance acerca a los robots a aplicaciones reales en fábricas, centros logísticos, hospitales, laboratorios e incluso entornos domésticos, donde cada tarea requiere una adaptación constante al espacio y a los objetos disponibles.

Otro diferencial es que el sistema puede reaccionar si ocurre algo inesperado. Si un objeto cambia de posición o aparece un obstáculo durante la ejecución de una tarea, el modelo es capaz de recalcular sus movimientos y encontrar una nueva forma de completar el objetivo, reduciendo la necesidad de intervención humana.

Tres modelos trabajan juntos para controlar los robots

Gemini Robotics 2 no está compuesto por un único modelo de inteligencia artificial. En realidad, Google ha dividido el sistema en tres componentes especializados, cada uno responsable de una etapa diferente de la operación.

El primero es Gemini Robotics 2, un modelo de visión, lenguaje y acción (Vision-Language-Action) encargado de transformar comandos escritos o hablados en movimientos físicos coordinados.

El segundo componente es Gemini Robotics ER 2 (Embodied Reasoning). Este modelo actúa como el “cerebro estratégico” del robot. Interpreta el entorno, planifica secuencias largas de tareas, identifica obstáculos, decide el orden correcto de las acciones y también puede coordinar varios robots trabajando juntos en una misma actividad.

El tercer modelo es Gemini Robotics On-Device 2, diseñado para funcionar directamente en el hardware del robot, sin depender constantemente de la nube. Esto reduce la latencia de las respuestas, mejora la privacidad de los datos y permite que el sistema siga funcionando incluso en lugares sin conexión a internet.

Según Google, este modelo también puede adaptarse rápidamente a diferentes plataformas robóticas utilizando solo unas horas de entrenamiento y menos de 200 ejemplos, reduciendo significativamente el tiempo necesario para poner nuevos robots en operación.

Manipulación fina acerca a los robots a las habilidades humanas

Además de la movilidad, otro punto que llamó la atención fue el avance en la llamada destreza robótica.

Controlando una mano robótica de cinco dedos equipada con 22 grados de libertad, Gemini Robotics 2 puede realizar movimientos extremadamente delicados. Entre las demostraciones se incluyen cerrar bolsas con cierre tipo zip, hacer nudos en cuerdas, enroscar bombillas y manipular pequeños objetos con precisión.

Este tipo de habilidad representa uno de los mayores desafíos de la robótica moderna. Aunque los robots industriales ya realizan tareas repetitivas desde hace décadas, reproducir los movimientos precisos de las manos humanas requiere un control refinado de fuerza, velocidad y coordinación.

El propio Google reconoce que sus robots aún no alcanzan el mismo nivel de precisión y velocidad que una persona, pero afirma que los resultados obtenidos muestran una evolución importante hacia sistemas capaces de ejecutar trabajos más variados en entornos reales.

Los robots comienzan a trabajar en equipo

Otra novedad importante es la capacidad de colaboración entre distintos robots.

Con Gemini Robotics ER 2, diferentes máquinas pueden compartir información sobre el entorno, dividir tareas y coordinar acciones de forma similar a equipos humanos. Esto permite, por ejemplo, que un robot transporte objetos mientras otro organiza materiales o prepara la siguiente etapa del trabajo.

Esta coordinación es posible porque todos utilizan una representación semántica común del entorno, lo que facilita la comprensión de las acciones realizadas por cada miembro del equipo.

Esta característica puede abrir la puerta a aplicaciones en centros logísticos, líneas de producción, hospitales, almacenes automatizados y operaciones industriales a gran escala.

La seguridad sigue siendo una prioridad para Google

Junto con Gemini Robotics 2, Google DeepMind también anunció ASIMOV-Agentic, un nuevo benchmark creado para evaluar la seguridad de los sistemas de inteligencia artificial que controlan robots.

La herramienta analiza situaciones en las que los comandos pueden derivar en comportamientos peligrosos, verifica si los robots pueden identificar personas cercanas, detener movimientos cuando es necesario y solicitar ayuda humana ante escenarios inciertos.

La preocupación no es solo técnica. A medida que los modelos de IA comienzan a controlar máquinas capaces de interactuar físicamente con personas, también aumenta la necesidad de crear mecanismos que eviten accidentes o interpretaciones incorrectas de los comandos.

El avance refuerza la apuesta de Google por la robótica inteligente

El anuncio muestra que Google DeepMind continúa ampliando su presencia en la carrera por la llamada IA incorporada, un área que busca llevar modelos generativos a robots capaces de comprender el entorno físico y actuar de forma autónoma.

En los últimos años, empresas como Tesla, Figure AI, Agility Robotics, Boston Dynamics y Apptronik también han acelerado sus inversiones en robots humanoides, impulsadas por el rápido avance de los grandes modelos de lenguaje. Mientras antes la inteligencia artificial se utilizaba principalmente para responder preguntas o generar textos e imágenes, ahora comienza a interpretar espacios tridimensionales, tomar decisiones en tiempo real y ejecutar movimientos físicos complejos.

Según Carolina Parada, líder del área de robótica de Google DeepMind, este avance representa un paso más en la construcción de la llamada AGI física, un concepto que busca crear sistemas capaces de realizar cualquier tarea física que un ser humano pueda ejecutar.

Aunque aún existen desafíos importantes, especialmente relacionados con la velocidad, la confiabilidad y la seguridad, Gemini Robotics 2 demuestra que esta visión comienza a salir del ámbito de la investigación para acercarse cada vez más a aplicaciones concretas.

Seguir:
Renê Fraga es fundador de Google Discovery y editor en jefe de Eurisko, un ecosistema editorial independiente dedicado a la tecnología, la ciencia y la innovación. Profesional del marketing digital, con posgrado por la ESPM, sigue de cerca a Google desde la década de 2000 y escribe desde hace más de 20 años sobre tecnología, productos digitales e inteligencia artificial. Fundó Google Discovery en 2006, convirtiéndolo en uno de los principales sitios especializados en Google en Brasil, y fue columnista de TechTudo (Globo.com).
No hay comentarios