Principales destacados:
- Google presentó Gemini Omni, una nueva generación de inteligencia artificial multimodal enfocada en la creación de videos a partir de distintos tipos de contenido.
- La tecnología puede comprender texto, imágenes, audio y video al mismo tiempo para generar resultados más naturales, coherentes y detallados.
- Gemini Omni Flash debutará integrado en Gemini, YouTube Shorts y Flow, mientras versiones más avanzadas llegarán más adelante para creadores y empresas.
Google dio uno de los pasos más importantes de su estrategia en inteligencia artificial durante el Google I/O al presentar oficialmente Gemini Omni, una nueva familia de modelos multimodales creada para transformar cualquier tipo de entrada en contenido audiovisual generado por IA.
La propuesta va mucho más allá de los actuales generadores de video disponibles en el mercado y acerca a Google a la idea de una inteligencia artificial capaz de entender el mundo de una forma más cercana a la percepción humana.
Según Sundar Pichai, CEO de Google, el proyecto representa la evolución natural de Gemini, un modelo que ya había nacido con enfoque multimodal cuando fue presentado hace algunos años. La diferencia ahora es que Omni no solo procesa diferentes formatos de medios por separado, sino que también puede razonar entre ellos para crear respuestas unificadas y mucho más inteligentes.
En la práctica, esto significa que los usuarios podrán combinar imágenes, videos, audio y texto en una sola instrucción y recibir como resultado un video completamente nuevo, con narrativa coherente, consistencia visual y comprensión contextual muy superior a la que ofrecen actualmente las herramientas tradicionales de IA.
Google quiere transformar Gemini en un modelo que “simula la realidad”
Durante la presentación para periodistas y desarrolladores, Google reforzó que Gemini Omni forma parte de un movimiento más amplio dentro de la compañía: convertir los modelos de lenguaje en “world models”, sistemas capaces de comprender y simular aspectos del mundo real.
Pichai explicó que el entrenamiento multimodal de Gemini, utilizando texto, código, audio, imágenes y video, ayudó a la IA a desarrollar una comprensión más profunda sobre física, comportamiento humano, cultura, ciencia y relaciones espaciales. Esa base permitió a Google crear un sistema que no solo genera contenido, sino que también entiende contexto e intención.
Ese concepto quedó claro en los ejemplos mostrados por la empresa. En una de las demostraciones, Gemini Omni recibió la solicitud de crear una explicación estilo “claymation” sobre el plegamiento de proteínas. En pocos segundos, la IA produjo un video completo con apariencia de animación stop motion y narración automática explicando conceptos científicos de manera clara y visualmente consistente.
Según Koray Kavukcuoglu, director de tecnología de Google DeepMind, la gran diferencia de Omni está precisamente en su capacidad de comprender relaciones complejas entre distintos tipos de medios al mismo tiempo. Esto hace que el resultado final parezca más natural y menos “armado” artificialmente.
Gemini Omni también edita imágenes usando lenguaje natural
Además de generar videos, Omni incorpora herramientas avanzadas de edición de imágenes. Los usuarios podrán modificar fotografías usando únicamente descripciones de texto, sin necesidad de abrir programas profesionales o aprender técnicas complejas de edición.
El funcionamiento recuerda a herramientas experimentales ya vistas anteriormente en Google, como Nano Banana, pero ahora integradas en un sistema multimodal mucho más amplio. Esto permite, por ejemplo, cambiar escenarios, eliminar personas, sustituir elementos visuales e incluso modificar completamente el estilo de una imagen simplemente conversando con la IA.
A pesar de la facilidad, los ejecutivos de DeepMind advirtieron que las instrucciones deberán ser bastante específicas. De lo contrario, la IA podría alterar elementos que el usuario deseaba mantener, un problema que ya ocurre en varios modelos generativos actuales.
Aun así, el potencial creativo llama la atención. Google cree que la simplicidad de la interfaz puede ayudar a popularizar la creación audiovisual con IA entre consumidores comunes, algo que todavía no había ocurrido a gran escala con modelos de video más técnicos y complejos.
Los avatares digitales ganan espacio dentro del ecosistema Gemini
Una de las novedades que más llamó la atención durante el anuncio fue la posibilidad de crear videos utilizando avatares digitales personalizados. Los usuarios podrán generar versiones virtuales de sí mismos para aparecer en videos creados por la IA.
La funcionalidad recuerda herramientas vistas anteriormente en Sora, de OpenAI, especialmente el antiguo sistema Cameos. Sin embargo, Google afirma haber desarrollado un proceso específico de seguridad para evitar el uso indebido de la tecnología.
Antes de habilitar la creación del avatar, el usuario deberá pasar por un proceso dedicado de verificación. Durante este procedimiento será necesario grabar videos pronunciando secuencias numéricas específicas para comprobar autenticidad. Después de la validación, el avatar quedará almacenado para futuras producciones.
La empresa también confirmó que todos los contenidos creados con Gemini Omni incluirán automáticamente la marca de agua digital SynthID. Esta tecnología desarrollada por Google sirve para identificar si imágenes o videos fueron producidos mediante inteligencia artificial.
La preocupación por los deepfakes y la manipulación digital ha crecido rápidamente en el sector de la IA generativa, especialmente después de la explosión de herramientas capaces de crear videos hiperrealistas. Por eso, Google intenta posicionar Omni como una plataforma poderosa, pero también responsable en relación con la autenticidad del contenido.
Gemini Omni Flash llega primero al público general
La primera versión lanzada comercialmente será Gemini Omni Flash. El modelo comenzará a estar disponible inicialmente dentro de la aplicación Gemini, YouTube Shorts y la plataforma creativa Flow.
En el lanzamiento, los videos tendrán un límite de hasta 10 segundos. Según Nicole Brichtova, directora de producto de DeepMind, esta limitación no representa una restricción técnica definitiva, sino una decisión estratégica para facilitar la adopción inicial de la herramienta.
Google considera que el consumo actual de videos cortos, impulsado por TikTok, Shorts y Reels, convierte este formato en el punto ideal para introducir la tecnología al público general. Aun así, la compañía ya trabaja en versiones capaces de generar videos más largos.
Durante las demostraciones, los ejemplos mostraron usos bastante casuales y orientados al entretenimiento personal. Entre ellos aparecieron videos ficticios de usuarios recibiendo premios, viajando al espacio o modificando grabaciones de vacaciones y viajes.
Gabe Barth-Maron, investigador de DeepMind, resumió estos contenidos como “memes personalizados”, destacando que el objetivo inicial de Flash es acercar la creación audiovisual con IA a consumidores comunes.
Google también apunta a publicidad, cine y creación profesional
Aunque el enfoque inicial está dirigido al consumidor, el potencial profesional de Gemini Omni es enorme. Google confirmó que el modelo estará disponible vía API en las próximas semanas, permitiendo integraciones con herramientas corporativas y flujos profesionales de creación.
Esto abre espacio para aplicaciones en publicidad, marketing, producción audiovisual, cine, diseño y campañas automatizadas. La capacidad de Omni para generar textos correctamente dentro de los videos también fue destacada por Google como una ventaja importante para anuncios y branding.
Según Nicole Brichtova, el modelo muestra un rendimiento especialmente fuerte en la renderización de textos, algo que históricamente ha sido uno de los mayores problemas de los modelos generativos de imagen y video.
El mercado ya observa movimientos similares en startups como Luma AI, que desarrolla sistemas capaces de crear campañas publicitarias completas utilizando apenas una imagen de producto y un breve briefing textual.
Sin embargo, Google parece apostar por un diferencial importante: integrar toda esta experiencia directamente al ecosistema Gemini, conectando IA multimodal, generación de medios, edición y distribución en plataformas gigantescas como YouTube.
Omni Pro debería ampliar aún más las capacidades de la IA
Además de Flash, Google confirmó que trabaja en una versión más avanzada llamada Gemini Omni Pro. Esta variante debería ofrecer calidad superior en prácticamente todas las tareas multimodales.
Aunque todavía no existe una fecha oficial de lanzamiento, Google afirmó que la versión Pro será presentada cuando represente un salto significativo respecto a Flash.
La expectativa es que este modelo más robusto esté dirigido principalmente a creadores profesionales, empresas, estudios y aplicaciones comerciales más complejas, incluyendo producción cinematográfica y flujos completos de contenido generado por IA.
Con Gemini Omni, Google deja claro que la competencia por la próxima generación de inteligencia artificial no se limitará al texto o los chatbots. El objetivo ahora es construir modelos capaces de comprender y generar cualquier tipo de contenido digital de manera integrada, acercando la IA a algo cada vez más parecido a la creatividad humana.