IA

Gemini 3.8 Live da rostro en tiempo real a los asistentes de IA

Adrian Kessler
Añádenos en Google

El sistema es Gemini 3.8 Live con Live Avatar. Combina el modelo de voz a voz de Google con una capa de vídeo en tiempo real que genera movimientos de labios y expresiones faciales, mientras gestiona llamadas a herramientas en segundo plano sin interrumpir la conversación. La detección del idioma es automática: el avatar cambia de idioma hablado a mitad de la llamada sin transferencias, sin recargar el sistema y sin pausas perceptibles.

Lo que distingue este sistema de las técnicas de superposición de vídeo es que la generación de audio y vídeo se ejecuta en una misma ruta de inferencia en directo, en lugar de hacerlo en pasos consecutivos. Esa integración mantiene la latencia lo bastante baja como para permitir un ritmo de conversación natural. Google incorpora de forma imperceptible marcas de agua SynthID tanto al audio como al vídeo: cada segundo lleva una etiqueta legible por máquinas que lo identifica como contenido generado por IA, aunque la retransmisión se grabe y se reproduzca más tarde. La marca de agua resiste la recodificación, por lo que sigue siendo posible verificar la procedencia de los clips exportados.

Equal AI, que gestiona despliegues empresariales en toda India, ofrece la indicación más clara de lo que permite el sistema a escala operativa: nueve idiomas indios activos simultáneamente, más de un millón de llamadas en directo al día y una cobertura total de 97 idiomas. Alcanzar ese volumen de actividad con agentes humanos, manteniendo una disponibilidad y una cobertura horaria equivalentes, resultaría económicamente inviable. El planteamiento del despliegue no parte de una prueba de concepto, sino del volumen de procesamiento.

Lo que Google no ha desvelado con el lanzamiento es el precio. La compañía no ha publicado los costes y remite las consultas a su equipo de ventas para empresas. La creación de avatares personalizados —es decir, que las organizaciones generen un rostro a partir de sus propias imágenes de referencia— requiere que Google las incluya en una lista de acceso autorizado mediante un proceso de verificación independiente; no se ofrece como opción de autoservicio. Las funciones de Extended Thinking para el modelo Live siguen en fase de prueba privada, lo que limita la profundidad de razonamiento frente a otras ofertas de Gemini de Google. Tampoco se han comunicado los límites de sesiones simultáneas. El perfil restringido de este lanzamiento encaja con la estrategia habitual de Google para las implantaciones empresariales por fases, en las que el precio y la capacidad se negocian en vez de hacerse públicos.

Gemini 3.8 Live con Live Avatar ya está disponible en la consola Gemini Enterprise y a través de Live API, con puntos de acceso en Estados Unidos y la Unión Europea. Google no ha anunciado cuándo estará disponible Extended Thinking para el modelo Live más allá del grupo actual de usuarios en la fase de prueba privada.

Las empresas que lo desplieguen responderán a una pregunta que la tecnología no puede resolver: si eliminar la señal visual que delata una interacción automatizada mejora la experiencia de los usuarios o si, por el contrario, suprime el último indicio honesto de que están hablando con un sistema automático.

Etiquetas: , , , , ,

Añádenos en Google

Debate

Hay 0 comentarios.