IA

El equipo de 10 personas de Microsoft construyó un modelo de voz más barato y rápido que OpenAI y Google

Adrian Kessler

El modelo se llama MAI-Transcribe-2. Microsoft AI, la división dirigida por Mustafa Suleyman, lo lanzó el 3 de septiembre a 0,10 dólares por hora de audio —precio limitado hasta finales de 2026. La versión anterior, MAI-Transcribe-1.5, costaba 0,36 dólares por hora. Esa reducción del 72% no es un redondeo de marketing. Un centro de contacto que procese 100.000 horas de audio al año pagaba 36.000 dólares por el modelo anterior; la misma carga de trabajo cuesta ahora 10.000 dólares.

El rendimiento en los tests comparativos es lo que hace inusual el precio. En la evaluación multilingüe FLEURS, MAI-Transcribe-2 ocupa el primer puesto entre 60 idiomas con una tasa media de error por palabra del 5,2% —mejor que GPT-Transcribe de OpenAI, Gemini 3.5 Transcribe de Google, ElevenLabs Scribe v2 y Whisper V3-Large de Meta. En la clasificación de Artificial Analysis, que mide conjuntamente precisión y latencia, se sitúa en segundo lugar global y define lo que los investigadores denominan la frontera de Pareto —el límite a partir del cual no se puede mejorar una métrica sin empeorar la otra. El modelo se entrenó para situarse en el borde eficiente de esa frontera, no para perseguir el primer puesto en ninguna tabla de una sola métrica.

La velocidad es el segundo aspecto que merece análisis. Microsoft afirma que MAI-Transcribe-2 procesa audio 10 veces más rápido que GPT-Transcribe, 7 veces más rápido que ElevenLabs Scribe v2 y 5 veces más rápido que Gemini 3.5 Transcribe. Para audio de larga duración —transcripción de pódcasts, declaraciones judiciales, notas clínicas— esa diferencia determina si un flujo de trabajo se ejecuta en segundos o en minutos. El modelo también realiza diarización de hablantes (identificar quién habló y cuándo), marcas de tiempo a nivel de palabra, sesgo de palabras clave para terminología de dominio y soporte para cambio de código en idiomas que se mezclan a mitad de frase, citando específicamente el hinglish y el spanglish como ejemplos probados.

El equipo que lo ha creado es notable en proporción a lo que ha creado. Microsoft describe el grupo central como 10 personas, que operan con una burocracia interna mínima y reciben apoyo de equipos más grandes encargados de la adquisición de datos y la gestión de proveedores. La afirmación resultante sobre eficiencia de GPU es concreta: MAI-Transcribe-2 funciona a la mitad del coste de GPU de los modelos punteros de la competencia. Si eso se mantiene bajo carga empresarial a gran escala no es verificable a partir del anuncio, pero la afirmación sobre la arquitectura es lo suficientemente precisa como para ponerla a prueba.

El modelo ya está disponible en Microsoft Foundry, MAI Playground y Open Router —lo que significa que el acceso no requiere un contrato con Azure ni una relación empresarial con Microsoft. Esa amplitud de distribución es deliberada. La apuesta de Microsoft AI por las API directas para desarrolladores forma parte de un reposicionamiento más amplio tras la reestructuración de la alianza con OpenAI. Las modificaciones de octubre de 2025 y abril de 2026 eliminaron los acuerdos de exclusividad y reparto de ingresos que habían definido la relación desde 2019. Microsoft tiene ahora un incentivo directo para competir en la capa de modelos en lugar de limitarse a distribuir los resultados de OpenAI.

El precio de 0,10 dólares está marcado como limitado hasta finales de 2026. No se ha revelado el precio estándar posterior a esa fecha. Quienes evalúan MAI-Transcribe-2 para cargas de trabajo de producción están tasando un producto cuyo coste desconocen para el año natural 2027. Ese es un riesgo que merece la pena señalar con claridad, aunque la tarifa actual haga atractivo el modelo frente a cualquier alternativa visible.

Etiquetas: , , , , ,

Debate

Hay 0 comentarios.