InicioCiencia y ComputaciónGemini Live da un salto en voz y automatización

Gemini Live da un salto en voz y automatización

Google ha reforzado las capacidades de su asistente de voz con la incorporación de Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos diseñados para mejorar las conversaciones en tiempo real y ampliar la capacidad de la inteligencia artificial para comprender información, razonar y ejecutar tareas mientras mantiene una interacción natural.

La evolución forma parte de la apuesta de Google por convertir la interacción mediante voz en una experiencia más fluida y útil. Los nuevos modelos permiten mantener conversaciones con interrupciones, procesar información visual y ejecutar determinadas herramientas en segundo plano, aunque cada versión está orientada a necesidades diferentes.

Dos modelos para distintas tareas

Gemini 3.8 Live está diseñado para las interacciones cotidianas. Google destaca su velocidad, eficiencia y capacidad para procesar entradas visuales prácticamente en tiempo real, incorporando ese contexto a las respuestas que ofrece.

El modelo también está preparado para conversaciones dinámicas en las que el usuario puede interrumpir una respuesta o cambiar de tema. Además, reconoce hasta 97 idiomas y permite alternar entre lenguas compatibles dentro de una misma conversación.

Otra de sus características es la capacidad multitarea. Mientras mantiene una conversación, Gemini 3.8 Live puede ejecutar herramientas y realizar llamadas a API en segundo plano para completar determinadas solicitudes.

Google ya ha comenzado a habilitar este modelo para desarrolladores mediante la API de Gemini y Google AI Studio. También está disponible en una vista previa privada de Gemini Enterprise y en Search Live para el público general. La compañía ha anunciado, además, su próxima llegada a la experiencia de cliente de Gemini Enterprise, aunque todavía no ha comunicado una fecha específica.

Razonamiento más profundo

La segunda propuesta, Gemini 3.8 Live Extended Thinking, está orientada a tareas que requieren mayor capacidad de razonamiento y procesos compuestos por varios pasos.

El modelo conserva la interacción por voz en tiempo real mientras desarrolla flujos de trabajo complejos y procesa información visual. Una de sus características es que proporciona señales verbales durante el proceso, permitiendo que la persona sepa que la IA está realizando comprobaciones o avanzando en una tarea.

Esta capacidad busca que las operaciones más complejas resulten comprensibles para el usuario, sin convertir la interacción en una sucesión de respuestas aisladas.

Disponibilidad ampliada

Gemini 3.8 Live Extended Thinking está disponible para desarrolladores a través de la API de Gemini y Google AI Studio. En el ámbito empresarial, Google ofrece acceso mediante una vista previa privada de Gemini Enterprise y ha anunciado futuras incorporaciones para clientes empresariales de Customer Experience y Google Workspace.

Para usuarios finales, el modelo está disponible en Gemini Live y también para determinados suscriptores de servicios de Google AI en herramientas como Docs, Gmail y Keep.

La disponibilidad concreta depende del producto, modalidad de suscripción y tipo de usuario, por lo que no todas las funciones están habilitadas de la misma manera en cada servicio.

Audio con identificación digital

Los dos modelos incorporan además SynthID, el sistema de marca de agua digital de Google para contenidos generados mediante inteligencia artificial.

En el caso del audio, la marca se integra de forma imperceptible para el oído humano directamente en la salida generada. Su función es facilitar la identificación y verificación de contenido de voz producido mediante IA.

SynthID también se utiliza en otros productos de inteligencia artificial de Google y forma parte de la estrategia de la compañía para incorporar mecanismos de identificación en contenidos generados artificialmente.

Con estos nuevos modelos, Google amplía el alcance de Gemini Live desde una herramienta centrada en conversaciones hacia un asistente capaz de combinar voz, comprensión visual, razonamiento y ejecución de tareas. La diferencia entre ambas versiones se encuentra principalmente en el tipo de uso: Gemini 3.8 Live prioriza rapidez y fluidez para interacciones habituales, mientras que Gemini 3.8 Live Extended Thinking está orientado a procesos que requieren análisis más profundo y varios pasos.

ARTÍCULOS RELACIONADOS
- Advertisment -

MÁS POPULARES