IA

Gemini 3.5 Transcribe de Google corrige el audio en más de 85 idiomas

Adrian Kessler

Gemini 3.5 Transcribe no se limita a capturar lo que alguien dice. Convierte lo que han dicho en lo que pretendían decir. Cuando un hablante se corrige a mitad de frase —«Programémoslo para el martes, no, miércoles»— el modelo devuelve «miércoles» y descarta la corrección. Las muletillas desaparecen. El ruido de fondo no lo detiene. El resultado es un texto pulido y formateado, no una captura de audio en bruto.

Para cualquiera que grabe entrevistas, podcasts o contenido multilingüe, esta distinción es todo el flujo de trabajo. Todas las herramientas de transcripción del mercado manejan «lo que se dijo». El editor humano que después lo limpiaba se encargaba de todo lo demás. Google ahora integra ese editor directamente en el modelo.

El modelo ofrece dos vías de API diferenciadas. La Live API gestiona streaming bidireccional continuo con latencia de menos de un segundo —diseñada para agentes de voz en tiempo real, bots de atención al cliente y cualquier cosa que necesite transcripción instantánea. La Interactions API maneja audio grabado: reuniones completas, registros de llamadas y entrevistas, devolviendo atribución de hablante para hasta tres participantes con marcas de tiempo. Ambas logran una tasa de error por palabra del 4,0% en modo streaming y del 2,6% en modo no streaming —medida por la firma independiente de evaluación comparativa Artificial Analysis. El anterior modelo de voz a texto de Google, Chirp 3, requería un 70% más de tiempo para alcanzar la transcripción final.

La vertiente de consumo del lanzamiento es más modesta. En Android, Gboard Rambler ya utiliza Gemini 3.5 Transcribe para la entrada de voz a texto. La aplicación de Gemini para macOS lo admite en inglés mediante la función Speak to Window. Chrome aparece como «próximamente», lo que permitiría a los usuarios dictar en cualquier campo web —respuestas, publicaciones, formularios— sin cambiar de aplicación. No se ha confirmado una fecha concreta para su despliegue.

Los límites del modelo importan. La atribución de múltiples hablantes se limita a tres participantes; los paneles y mesas redondas con más participantes requieren soluciones alternativas. La aplicación Rambler de consumo está disponible actualmente en «países e idiomas seleccionados», no en los 85 que soporta el modelo. Google no ha anunciado precios para la API, que se encuentra en vista previa pública a través de Google AI Studio. El acceso empresarial se realiza a través de Gemini Enterprise Agent Platform, donde los precios se negocian por separado. Para los creadores más pequeños, la cuestión del coste sigue abierta.

El marco competitivo también es relevante. Whisper de OpenAI, aún la opción predeterminada para desarrolladores independientes, logra tasas de error por palabra en el rango del 5–7% en audio en inglés y requiere código de posprocesamiento para eliminar muletillas y dar formato. Servicios como AssemblyAI y Deepgram ofrecen diarización de hablantes, pero no la corrección de lenguaje natural integrada que Gemini 3.5 Transcribe aplica por defecto. La brecha es medible, aunque determinar cómo se sostiene en el extremo más difícil del rango de 85 idiomas —acentos regionales, idiomas con pocos recursos, entornos ruidosos— requerirá pruebas independientes.

La característica que más indica sobre la dirección a largo plazo de Google es la integración con Chrome. Una vez que la entrada por voz funcione en cualquier campo web, el modelo deja de ser una herramienta para desarrolladores y se convierte en infraestructura para la forma en que las personas escriben. El calendario de despliegue de ese cambio no se ha confirmado.

Etiquetas: , , , , ,

Debate

Hay 0 comentarios.