IA

La IA de voz de OpenAI ya no espera su turno — y cuesta $0,05 el minuto

Susan Hill

Cada asistente de voz del mercado te pide hoy que esperes antes de hablar. El GPT-Live-1 de OpenAI no lo hace. El modelo, disponible a través de la API de OpenAI, escucha y habla al mismo tiempo —gestiona interrupciones, pausas y solapamientos como haría una persona en una conversación telefónica.

El precio es de 0,05 dólares por minuto para la capa de voz —1,50 dólares por una conversación de 30 minutos, o 50 dólares por cada 1.000 minutos de conversación. Los desarrolladores pagan aparte por un backend de razonamiento: el GPT-6 Astra de OpenAI o cualquier modelo compatible que gestione llamadas a herramientas y lógica de negocio. La capa de voz se encarga de la mecánica conversacional; la capa de razonamiento decide qué dice y hace realmente la IA.

Lo que esa separación significa en la práctica: un bot de atención al cliente puede oír «espera, en realidad quiero la otra opción» a mitad de frase y responder a ello, en lugar de seguir adelante con una respuesta preparada. Un tutor de idiomas puede detectar que un alumno tropieza con una palabra sin esperar a que termine. Un sistema de reservas puede manejar el tipo de llamada real en la que la gente se repite, cambia de opinión y habla al mismo tiempo.

En el Full Duplex Bench —la evaluación diseñada específicamente para probar el manejo simultáneo de voz en ambas direcciones— el GPT-Live-1 obtiene 30 puntos porcentuales más que su predecesor, el GPT-Realtime-2.1. Cuando se combina con GPT-6 Astra como backend de razonamiento, supera a Tau3, el benchmark de atención al cliente que prueba consultas complejas de varios pasos sin pausas en la conversación.

La arquitectura de dos capas refleja una decisión de diseño deliberada. El ritmo del habla y el razonamiento se facturan por separado porque escalan de forma distinta: una startup que construye una aplicación ligera de tutorías paga menos en ambas capas que una empresa que gestiona miles de llamadas simultáneas de atención al cliente con GPT-6 Astra. El mínimo son 0,05 dólares por minuto para la voz, independientemente de lo que funcione detrás.

Lo que GPT-Live-1 no cambia es la calidad de las respuestas. La capa de voz gestiona cuándo y cómo habla la IA —no lo que sabe. Una mala respuesta bien sincronizada sigue siendo una mala respuesta. Los desarrolladores que construyan aplicaciones de atención al cliente tendrán que evaluar ambas capas por separado, y el backend de razonamiento puede añadir más a la factura que la propia capa de voz. OpenAI tampoco ha publicado datos sobre cómo se comporta la arquitectura full-duplex en entornos de bajo ancho de banda o en líneas telefónicas con ruido, donde la entrada de audio continua es más difícil de mantener.

GPT-Live-1 ya está disponible en la API de OpenAI. La compañía no ha anunciado un producto orientado al consumidor construido sobre el modelo, aunque ha indicado que futuras versiones del modo de voz de ChatGPT podrían basarse en la misma arquitectura subyacente. La tarifa de 0,05 dólares por minuto se aplica desde el lanzamiento; OpenAI no ha publicado un calendario de cambios de precios ni una lista de modelos de razonamiento de terceros aprobados para su uso con la capa de voz.

Etiquetas: , , , , ,

Debate

Hay 0 comentarios.