InicioCiencia y ComputaciónGemini 3.8 Flash mejora la generación de voz con IA

Gemini 3.8 Flash mejora la generación de voz con IA

Google ha comenzado a desplegar Gemini 3.8 Flash TTS y Flash-Lite TTS, dos modelos de texto a voz para producir audios más expresivos. La actualización incorpora clonación de voz autorizada y herramientas para dirigir guiones con emociones, acentos y pausas.

El objetivo es alejarse de la locución sintética y acercarse a una interpretación más natural. Los nuevos modelos permiten controlar ritmo, intención y emoción con mayor precisión.

Voces con más personalidad

Gemini 3.8 Flash TTS puede generar voces originales a partir de descripciones realizadas en lenguaje natural. También ofrece compatibilidad con más de 100 idiomas y dialectos y un catálogo de más de 2.000 voces.

Una de las funciones más llamativas es la clonación de voz. El sistema puede reconstruir una identidad vocal utilizando una muestra de aproximadamente 30 segundos, siempre que exista autorización para utilizarla. La voz puede mantenerse coherente durante grabaciones prolongadas, útil para podcasts, audiolibros, doblajes y agentes conversacionales.

También facilita adaptar un contenido a diferentes mercados conservando una identidad vocal entre idiomas o dialectos.

Control sobre cada línea del guion

La actualización no se limita a elegir una voz. Los modelos permiten indicar cómo debe interpretarse cada parte del texto mediante instrucciones específicas.

El usuario puede solicitar cambios de dialecto, susurros, risas, pausas o modificaciones de tono. Así, una misma voz puede transmitir diferentes emociones según el contexto de cada frase. El resultado busca parecerse más a una interpretación realizada por un actor que a una lectura automática.

Puede resultar útil para creadores y desarrolladores que necesitan generar audio manteniendo una identidad sonora consistente.

Diálogos con dos voces

Otra herramienta destacada permite generar conversaciones entre dos hablantes a partir de un único guion. El sistema asigna una voz a cada personaje y mantiene esa identidad durante toda la escena.

Esto simplifica la producción de diálogos y puede reducir el trabajo de edición en vídeos, podcasts y contenidos educativos.

Google también destaca la consistencia vocal durante sesiones largas y traslada al audio parte de la evolución de Gemini 3.8.

Resultados en las pruebas de Hume AI

En los benchmarks de Hume AI, Gemini 3.8 Flash TTS obtuvo 60,8 puntos en el Voice Design Benchmark dentro de la prueba de acentos. Además, Flash y Flash-Lite ocuparon las dos primeras posiciones del índice general de calidad de ese test.

Los modelos también aparecen entre los primeros puestos de Voice Arena en varios idiomas. Sin embargo, ElevenLabs continúa por delante en las categorías de calidad vocal individual y variación humana de Hume AI.

Estas mediciones sirven como referencia, aunque la elección también depende del idioma, el contenido y el nivel de control requerido.

Disponibilidad y medidas de seguridad

Para usuarios habituales, Flash TTS ya está disponible en Gemini Notebook, mientras que Flash-Lite TTS llega a Google Vids. Los desarrolladores pueden acceder a ambos modelos mediante la API de Gemini y Google AI Studio.

Google también ha incorporado medidas específicas para controlar la replicación de voces. Exige verificar el consentimiento, añade marcas de agua SynthID y credenciales C2PA, y limita la clonación en AI Studio en determinados mercados.

Con estas herramientas, la generación de voz mediante IA avanza hacia un modelo en el que no solo importa qué dice una voz, sino también cómo lo dice. Para creadores, esa diferencia puede convertir el audio generado en una herramienta más flexible para producir contenidos, diálogos y versiones multilingües.

ARTÍCULOS RELACIONADOS
- Advertisment -

MÁS POPULARES