IA

La IA de Alibaba que lee tu pantalla alcanza el 92% en móviles reales y puedes ejecutarla en tu propio hardware

Susan Hill

El Qwen-UI-Agent de Alibaba no necesita acceso especial a tus aplicaciones. Lee la pantalla, identifica lo que hay en ella y hace clic, gestionando tareas que van desde la mensajería hasta la edición de documentos únicamente mediante percepción visual. Los pesos del modelo — MAI-UI-2B y MAI-UI-8B — han aterrizado esta semana en Hugging Face, poniendo el sistema al alcance de cualquier desarrollador que tenga una GPU.

Los resultados son concretos. En MobileWorld, la evaluación estándar de agentes móviles, Qwen-UI-Agent obtuvo un 82,1%, superando a GPT-5.6 por 12 puntos porcentuales y a Claude Opus 4.8 por 14,6 puntos. La diferencia no es marginal — sistemas occidentales comparables llevan meses estancados en el rango bajo y medio de los 70 en la misma prueba. En pruebas sobre dispositivos reales — tareas ejecutadas en terminales Android físicos, no en emuladores — la puntuación ascendió al 92,2%. En AndroidDaily, una evaluación más amplia con teléfonos reales, el modelo alcanzó el 97,5%. Para uso en ordenadores de sobremesa, medido mediante OSWorld-Verified, registró un 79,5%, por delante tanto de GPT-5.5 como de Gemini 3.1 Pro.

Alibaba entrenó el modelo con datos de más de 100 dispositivos móviles reales que ejecutaban 150 aplicaciones distintas, y después construyó su propio banco de pruebas — MobileWorld-Real — con más de 400 tareas para verificar el rendimiento fuera del laboratorio. Aproximadamente el 40% de las tareas de escritorio implicaban operaciones por lotes en línea de comandos junto con clics visuales, una decisión de diseño que refleja cómo funciona la informática real, no cómo se montan las demostraciones.

Una capa de seguridad está integrada en el flujo de trabajo. El modelo rechaza las tareas que considera ilegales o de alto riesgo, y se detiene en operaciones sensibles — pagos, eliminación de datos, autorizaciones de privacidad — solicitando la confirmación explícita del usuario antes de continuar. El sistema maneja secuencias de más de 100 pasos mediante aprendizaje por refuerzo entrenado en unos 10.000 entornos simulados simultáneos.

Los resultados en los bancos de pruebas dejan abiertas las preguntas más difíciles. Qwen-UI-Agent fue evaluado en tareas estructuradas; el uso real del teléfono está plagado de interrupciones, saturado de notificaciones, e implica aplicaciones que actualizan sus interfaces sin previo aviso. La IA que lee la pantalla también plantea una cuestión de privacidad que el informe técnico de Alibaba no aborda: un modelo que procesa cada píxel de tu pantalla tiene acceso a datos bancarios, mensajes privados e información que la mayoría de los usuarios jamás ha considerado entregar a un sistema de terceros. No existen directrices sobre qué ocurre con esos datos en despliegues de terceros.

El proyecto está alojado en Tongyi-MAI/MAI-UI en GitHub; los pesos del modelo están ya en Hugging Face. No se ha anunciado ninguna API comercial ni precio de despliegue. La próxima prueba para Qwen-UI-Agent no es un banco de pruebas — es si los desarrolladores que trabajan sobre los pesos abiertos pueden igualar en producción lo que Alibaba registró en el laboratorio.

Etiquetas: , , , , ,

Debate

Hay 0 comentarios.