- Un modelo para crear. Otro para escalar. 🎙️
- De 30 voces a más de 2.000
- ¿Quieres una voz específica? Puedes describirla
- No se trata solo de una voz leyendo un guion
- Hasta las risas y los suspiros entran en escena
- ¿Y los benchmarks?
- El portugués brasileño aparece entre los destacados 🇧🇷
- ¿Quiénes ya los están utilizando?
- La carrera ahora es por una voz que parezca humana
Principales destacados
- Dos nuevos modelos: Gemini 3.8 Flash TTS y Flash-Lite TTS llegan a la API de Gemini y a Google AI Studio para la generación de voz.
- Voces a medida: Flash TTS permite crear perfiles vocales mediante prompts, replicar voces con autorización y trabajar con más de 100 idiomas y dialectos.
- Audio a gran escala: los modelos apuntan a podcasts, doblaje, localización y agentes de voz, con soporte para discursos largos y actuaciones con múltiples personajes.
Google quiere que la síntesis de voz deje de parecer simplemente una máquina leyendo texto.
La compañía presentó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos orientados a convertir texto en voz que llegan con una propuesta más ambiciosa: controlar no solo qué dice una voz, sino también cómo lo dice.
Ambos modelos ya comenzaron a estar disponibles a través de la API de Gemini y Google AI Studio.
Un modelo para crear. Otro para escalar. 🎙️
La división de tareas es relativamente sencilla.
Gemini 3.8 Flash TTS está diseñado para situaciones en las que la dirección creativa tiene mayor importancia. Por su parte, Flash-Lite TTS apunta a aplicaciones de alto volumen, en las que el costo y la escala tienen mayor peso.
En la práctica, Google intenta atender desde una producción audiovisual que necesita una voz muy específica hasta aplicaciones que deben generar enormes cantidades de audio.
🎭 La idea central: convertir instrucciones en interpretación.
Con Flash TTS, los desarrolladores pueden utilizar lenguaje natural para describir una voz, especificando elementos como el papel, el acento y las características vocales.
El sistema admite más de 100 idiomas y dialectos, ampliando también las posibilidades de localización de contenidos.
De 30 voces a más de 2.000
Uno de los cambios más visibles está en la cantidad de voces disponibles.
La biblioteca de Google, que contaba con unas 30 voces originales, pasa a ofrecer más de 2.000 opciones listas para producción.
Entre las variedades mencionadas están:
• español mexicano
• francés quebequense
• inglés escocés
Esto resulta especialmente relevante para contenidos internacionales. Una misma producción puede necesitar no solo una traducción, sino también una voz que suene natural en cada mercado.
Y Google va más allá de las voces preconfiguradas.
¿Quieres una voz específica? Puedes describirla
Gemini 3.8 Flash TTS permite crear voces originales a partir de prompts en lenguaje natural.
En lugar de limitarse a elegir entre una «voz masculina» y una «voz femenina», por ejemplo, el desarrollador puede orientar características relacionadas con la interpretación y la identidad vocal.
También existe una función de replicación de voz capaz de recrear un perfil vocal a partir de una muestra de aproximadamente 30 segundos.
Pero hay una condición importante: el usuario debe tener los derechos sobre esa voz.
🔐 El consentimiento forma parte del proceso: Google informa que el sistema exige una grabación de consentimiento verbal del propietario de la voz antes de realizar la replicación.
Los audios generados también reciben marca de agua SynthID y credenciales C2PA, mecanismos destinados a ayudar a identificar el origen y la autenticidad del contenido.
La función de replicación de voz mediante AI Studio, sin embargo, tiene restricciones geográficas y no está disponible en Illinois, Texas, el Espacio Económico Europeo, Reino Unido, Suiza e India.
No se trata solo de una voz leyendo un guion
Quizás el cambio más interesante esté en la forma en que el modelo interpreta el texto.
Ambos modelos admiten dirección de interpretación línea por línea, lo que permite controlar mejor cómo debe interpretarse cada fragmento.
Esto abre una diferencia importante entre el TTS tradicional y la generación de voz impulsada por IA.
Una frase puede estar escrita para transmitir determinada emoción. Otra puede requerir una pausa. Una tercera puede pedir una reacción espontánea.
💡 El objetivo es hacer que la voz interprete la escena, y no simplemente pronuncie las palabras.
El sistema también puede trabajar con audio de larga duración, incluyendo horas de generación, algo especialmente relevante para podcasts, audiolibros, narrativas y contenidos extensos.
Hasta las risas y los suspiros entran en escena
Los modelos también incorporan señales no verbales a la interpretación.
Entre los ejemplos están:
• risas
• suspiros
• interjecciones
• señales de escucha activa
También existe escenificación nativa de escenas con dos locutores, lo que permite producir diálogos para podcasts y narrativas dramáticas sin tener que tratar necesariamente a cada personaje como una grabación completamente independiente.
Esto acerca la tecnología a una especie de dirección de audio automatizada.
¿Y los benchmarks?
Google afirma que Gemini 3.8 Flash TTS alcanzó el primer puesto en el Voice Design Benchmark, de Hume AI, con una puntuación de 71,4.
En el benchmark de modelado de acentos, el modelo alcanzó 60,8.
Según la compañía, los dos nuevos modelos también ocuparon las dos primeras posiciones del Índice de Calidad General de Hume AI.
En evaluaciones ciegas de preferencia humana realizadas en Voice Arena, los modelos quedaron en los primeros puestos en idiomas que incluyen japonés, portugués brasileño, vietnamita e hindi.
Google presenta estos resultados como evidencia de que la mejora no está limitada al inglés.
El portugués brasileño aparece entre los destacados 🇧🇷
Este detalle llama especialmente la atención en el mercado brasileño.
El portugués brasileño aparece entre los idiomas en los que los modelos obtuvieron un desempeño destacado en las evaluaciones de preferencia humana.
Para empresas que trabajan con localización, publicidad, educación, atención automatizada y producción audiovisual, una voz natural en portugués puede ser tan importante como la capacidad de generar audio rápidamente.
🌎 La disputa ahora es por la naturalidad: no basta con que una IA pueda hablar portugués. Tiene que sonar como alguien hablando portugués.
¿Quiénes ya los están utilizando?
El ecosistema alrededor de la API de Gemini también comienza a incorporar los modelos.
Plataformas como Agora, LiveKit, Pipecat y Vercel ofrecen soporte para los nuevos modelos a través de la API de Gemini.
Entre las empresas mencionadas como integradoras están Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang.
Los principales casos de uso incluyen:
• doblaje
• localización de medios
• agentes de voz
• producción de contenidos
• aplicaciones conversacionales
El acceso empresarial a través de Gemini Enterprise está previsto para una etapa posterior.
La carrera ahora es por una voz que parezca humana
La evolución del TTS está cambiando el foco de la simple inteligibilidad hacia algo más difícil de medir: presencia.
Una voz puede pronunciar perfectamente cada palabra y aun así sonar artificial. El desafío consiste en reproducir ritmo, pausas, acento, emoción, reacción y contexto.
Con Gemini 3.8 Flash TTS y Flash-Lite TTS, Google intenta incorporar estos elementos directamente al proceso de generación.
Y, a medida que las voces sintéticas comienzan a aparecer en podcasts, vídeos, agentes de atención y doblajes, la pregunta deja de ser simplemente si la máquina puede hablar.
Pasa a ser: ¿cuánto tiempo tardaremos en darnos cuenta de cuándo está hablando por nosotros?