IA

ElevenLabs v4 clona tu voz con 10 segundos de audio y la hace hablar en 90 idiomas

Susan Hill
Añádenos en Google

ElevenLabs ha lanzado Eleven v4, un modelo de texto a voz que lee en voz alta cualquier texto con una carcajada, un suspiro o un acento francés enfadado, si así lo pide quien lo escribe. Para clonar una voz al instante basta con una grabación más corta que un mensaje del buzón de voz; después, la voz clonada puede hablar decenas de idiomas sin perder su timbre. Cualquier persona con una cuenta gratuita de ElevenLabs puede utilizarlo.

Para quienes crean contenido sonoro, esto puede ahorrar jornadas enteras de trabajo. Un pódcast puede doblar un episodio al japonés con la voz de quien lo presenta; un desarrollador de videojuegos independiente puede dar una forma de hablar distinta a cada personaje secundario sin reservar un estudio, y un narrador de audiolibros puede escribir una pausa o una risita directamente en el guion. La otra cara de la moneda es igual de clara: una nota de voz, un fragmento de una videollamada o unos segundos de una publicación pública bastan ahora para obtener una copia convincente de la voz de alguien.

El principal cambio es el control, y para crear el clon solo hacen falta 10 segundos de audio. Los modelos anteriores de ElevenLabs leían el texto con claridad, pero tenían que adivinar el estado de ánimo. La versión 4 acepta indicaciones escénicas escritas entre corchetes, como [se ríe] o [dicho con enfado y acento francés], e incluso pistas de fondo, como [lluvia ligera] o [teléfono vibrando]. La empresa asegura que el modelo también interpreta el tono y el ritmo a partir del contexto, de modo que una frase de una escena tensa suena tensa aunque no lleve ninguna etiqueta. En las escenas con varios interlocutores, cada voz mantiene la coherencia durante pasajes largos, algo que hasta ahora era un punto débil de la narración sintética: las voces tendían a cambiar a lo largo de un capítulo.

La cobertura lingüística pasa de los 70 idiomas de la versión anterior a más de 90. Según TechCrunch, ElevenLabs destacó que las mayores mejoras de calidad se dan en japonés, portugués brasileño, mandarín y cantonés. La voz clonada conserva su identidad al cambiar de idioma: el clon de una persona que habla español sigue sonando como ella al leer en alemán, pero con acento alemán nativo. Un segundo modelo, v4 Turbo, está pensado para asistentes de voz y agentes de centros de atención telefónica. Empieza a hablar en unos 150 milisegundos —más o menos, la pausa entre dos personas que se turnan en una conversación— y puede hacerlo antes de que el chatbot que lo alimenta haya terminado de redactar la respuesta.

ElevenLabs no está sola en este mercado. Google, OpenAI, Cartesia, Deepgram y Fish Audio venden voces sintéticas a los mismos desarrolladores. A las pocas horas del lanzamiento, la firma independiente de evaluación comparativa Artificial Analysis situó v4 en el primer puesto de su clasificación de voces, en la que los oyentes puntúan muestras anónimas comparándolas entre sí. ElevenLabs también afirma que, en pruebas a ciegas frente a sus competidores, alrededor de tres de cada cuatro oyentes prefirieron v4; una cifra obtenida en sus propias pruebas.

Las reservas empiezan por esos 10 segundos. ElevenLabs afirma que sus clones requieren el consentimiento de la persona cuya voz se sube a la plataforma, que cuenta con un clasificador público capaz de detectar audios generados con sus herramientas y que bloquea directamente los clones de algunas figuras políticas. Estas medidas frenan los usos indebidos más ocasionales, pero dependen de que quien sube el audio diga la verdad; a un estafador le basta una muestra breve de la voz de un familiar para simular una llamada de emergencia falsa. El plan gratuito también es limitado: unos 10 minutos de audio generado al mes, según el desglose de tarifas de Unite.AI, y los planes de pago empiezan en 6 dólares al mes.

Eleven v4 y v4 Turbo se lanzaron el 28 de septiembre en la aplicación para creadores de ElevenLabs, su plataforma de agentes y su API para desarrolladores. La empresa, con sede en Londres, captó 500 millones de dólares de Sequoia en febrero, con una valoración de 11.000 millones de dólares, y TechCrunch informa de que sus ingresos anualizados han superado los 600 millones. El consejero delegado, Mati Staniszewski, dijo a TechCrunch que la empresa aspira a salir a bolsa en los próximos años, aunque no se comprometió con ninguna fecha.

Para quienes crean contenido, una voz que se ríe cuando toca en 90 idiomas es un estudio de grabación en una pestaña del navegador. Para los demás, es un motivo más para colgar y volver a llamar cuando una voz familiar al teléfono pide dinero.

Etiquetas: , , , , ,

Añádenos en Google

Debate

Hay 0 comentarios.