- La idea parece abstracta. El resultado no lo es 🎯
- Un modelo modular, no un bloque único 🧩
- Cabe bastante información en la ventana de contexto 📦
- Y los vectores pueden hacerse más pequeños 📉
- El teléfono empieza a convertirse en el banco de datos 🔎
- Y esto puede funcionar sin transcribirlo todo 🎙️
- El rendimiento también mejoró
- Apache 2.0 abre la puerta a aplicaciones comerciales 🚪
- Pero existe una responsabilidad importante
- La apuesta de Google es mayor que un modelo de búsqueda
Principales destacados
- Un embedding multimodal: el modelo transforma texto, código, imágenes, vídeo y audio en vectores de 768 dimensiones dentro de un espacio compartido.
- Cabe en dispositivos pequeños: con 740 millones de parámetros, puede funcionar en teléfonos y notebooks, mientras que la versión completa ocupa unos 567 MB de memoria activa en un Pixel 11 Pro.
- Búsqueda multimedia sin nube: la tecnología puede encontrar una escena específica de un vídeo a partir de una descripción de texto o de una grabación de voz.
Google DeepMind presentó este martes 6 de octubre el EmbeddingGemma 2, un modelo de pesos abiertos creado para una tarea menos llamativa que generar textos e imágenes, pero fundamental para la inteligencia artificial actual: entender la relación entre diferentes tipos de información.
En lugar de producir una respuesta directamente, el modelo transforma los contenidos en representaciones numéricas llamadas embeddings. La diferencia ahora es que texto, código, imágenes, audio y vídeo pueden ocupar el mismo espacio matemático.
En la práctica, esto permite utilizar una frase para buscar una imagen, una grabación de voz para encontrar un fragmento de vídeo o una descripción de texto para localizar un momento específico dentro de horas de audio.
La idea parece abstracta. El resultado no lo es 🎯
Imagina una biblioteca gigantesca sin títulos, categorías ni etiquetas.
Para encontrar algo, habría que abrir archivo por archivo.
Un sistema de embeddings funciona de otra manera. Transforma cada contenido en una especie de coordenada matemática que representa su significado. Los contenidos semánticamente similares quedan cerca unos de otros dentro de ese espacio.
Es precisamente esta lógica la que está detrás de los mecanismos modernos de búsqueda y de los sistemas de RAG, o generación aumentada mediante recuperación, en los que la IA primero encuentra información relevante y después genera una respuesta.
EmbeddingGemma 2 lleva esta idea más allá del texto.
💡 El salto importante no consiste solo en entender más formatos. Consiste en hacer que formatos diferentes puedan compararse directamente.
Un modelo modular, no un bloque único 🧩
Los 740 millones de parámetros de EmbeddingGemma 2 no tienen que cargarse necesariamente de una sola vez.
Google estructuró el modelo en componentes que pueden combinarse según las necesidades:
| Componente | Parámetros |
|---|---|
| Texto y código | 270 millones |
| Visión | 170 millones |
| Audio | 300 millones |
| Modelo completo | 740 millones |
Esto crea una característica interesante.
Una aplicación puede utilizar únicamente el núcleo de texto y código para determinadas tareas y recurrir a los módulos de visión o audio cuando necesite buscar contenido multimedia.
Y todo continúa comunicándose dentro del mismo espacio de embeddings.
Esto significa, por ejemplo, que una consulta transformada en embedding por el componente de texto puede compararse directamente con contenidos procesados por el modelo multimodal completo.
Cabe bastante información en la ventana de contexto 📦
EmbeddingGemma 2 trabaja con una ventana de contexto de 8.192 tokens, cuatro veces mayor que la del primer EmbeddingGemma.
Según el material de Google, una única entrada puede contener aproximadamente:
• hasta 29 imágenes;
• hasta 58 fotogramas de vídeo;
• hasta 5,5 minutos de audio.
Eso no significa que el modelo esté simplemente “viendo” un vídeo completo como lo haría una persona.
La propuesta consiste en convertir estas diferentes modalidades en representaciones que puedan compararse para tareas de recuperación y búsqueda.
Y los vectores pueden hacerse más pequeños 📉
Otra característica importante es el Matryoshka Representation Learning.
La técnica permite reducir los embeddings de 768 a dimensiones más pequeñas, llegando hasta 128 dimensiones.
Esto puede reducir hasta seis veces el espacio necesario para almacenar los vectores.
Según la guía de desarrollo de Google, los embeddings de 256 dimensiones conservan alrededor del 95% de la calidad en la recuperación de imágenes, vídeos y voz.
Con 128 dimensiones, la calidad de la recuperación multimodal cae hasta aproximadamente el 75%.
Para sistemas que necesitan almacenar millones o miles de millones de embeddings, esta diferencia de tamaño puede dejar de ser un simple detalle técnico y convertirse en una cuestión importante de infraestructura.
El teléfono empieza a convertirse en el banco de datos 🔎
Uno de los puntos más interesantes del lanzamiento es precisamente dónde Google pretende colocar el modelo: en el dispositivo.
En un Pixel 11 Pro con cuantización, los pesos de la versión exclusiva para texto utilizan unos 191 MB de memoria activa.
La configuración multimodal completa ocupa aproximadamente 567 MB.
Es una diferencia enorme frente a la idea tradicional de enviar todo el contenido a un servidor, procesarlo en la nube y recibir el resultado de vuelta.
El modelo también está siendo integrado en demostraciones de Google AI Edge Gallery.
Una de ellas, llamada Instant Media Search, permite buscar fotos y vídeos almacenados localmente utilizando descripciones.
Otra, Video Moments Finder, puede localizar escenas específicas, como un perro atrapando un frisbee.
Y esto puede funcionar sin transcribirlo todo 🎙️
El ejemplo más interesante quizá sea la posibilidad de utilizar una grabación de voz para encontrar un fragmento específico de vídeo.
Imagina a alguien diciendo algo como: “encuentra ese momento en el que el perro corre detrás del frisbee”.
En lugar de depender exclusivamente de una transcripción del audio, el sistema puede comparar la representación semántica de la consulta con las representaciones visuales y multimodales de los contenidos.
Es un cambio sutil, pero importante: la búsqueda deja de depender tanto de las palabras que aparecen en un archivo y empieza a considerar lo que representa el contenido.
El rendimiento también mejoró
EmbeddingGemma 2 sucede al primer EmbeddingGemma, lanzado en septiembre de 2025.
La primera versión tenía 308 millones de parámetros, era exclusivamente de texto y estaba basada en Gemma 3.
Según Google, ya ha superado los 20 millones de descargas.
En la prueba de código del Massive Text Embedding Benchmark, el nuevo modelo habría alcanzado 78,68, frente a 68,76 de la generación anterior, una diferencia de 9,92 puntos.
Esto demuestra que el proyecto no está siendo tratado únicamente como una extensión multimodal. Google también está intentando mejorar el rendimiento en las tareas tradicionales de embeddings.
Apache 2.0 abre la puerta a aplicaciones comerciales 🚪
EmbeddingGemma 2 se distribuye bajo la licencia Apache 2.0, que permite su uso comercial.
Los pesos ya están disponibles en Hugging Face y Kaggle.
Google también afirma que pretende llevar el modelo a ML Kit para Android en las próximas semanas, con soporte para aceleración por hardware en dispositivos compatibles.
La llegada al Model Garden de Gemini Enterprise Agent Platform está prevista para más adelante.
Pero existe una responsabilidad importante
El model card informa de que EmbeddingGemma 2 no pasó por un ajuste de seguridad posterior al entrenamiento.
Esto no significa que el modelo sea necesariamente inseguro para cualquier aplicación. Significa que buena parte de las protecciones y decisiones de seguridad deberán implementarse en el propio sistema creado por el desarrollador.
Para quienes pretendan incorporar la tecnología a un producto, este detalle es mucho más importante de lo que parece.
La apuesta de Google es mayor que un modelo de búsqueda
El punto central de EmbeddingGemma 2 no es simplemente hacer mejores búsquedas en fotos o vídeos.
Es crear una especie de idioma matemático común para diferentes formatos de información.
Texto, audio, imágenes y vídeo dejan de ser compartimentos completamente separados. Para una aplicación, todos pueden convertirse en puntos comparables dentro del mismo espacio.
Esto abre el camino a sistemas locales capaces de buscar en grandes colecciones de contenido multimedia, organizar archivos automáticamente, encontrar momentos específicos en grabaciones y alimentar sistemas RAG sin necesidad de enviar todo el contenido a la nube.
Y hay una ironía interesante en todo esto.
Durante años, la evolución de la IA se presentó principalmente como una carrera para construir modelos cada vez más grandes. EmbeddingGemma 2 apunta en otra dirección: un modelo relativamente compacto, instalado en el dispositivo, puede ser extremadamente útil precisamente porque sabe dónde buscar.
Si esta estrategia funciona bien, quizá el próximo salto de la IA en el teléfono no consista solamente en conversar con el dispositivo. Puede consistir simplemente en encontrar cualquier cosa en él, independientemente de dónde esté escondida esa información.