阿里巴巴于8月20日正式推出Qwen-UI-Agent,这是一个以真实世界为中心的GUI智能体基座模型。该模型覆盖移动端、电脑端、网页端以及深度搜索环境,目标是让AI能够像人类一样直接操作各类屏幕界面,而不仅仅是生成文本。从官方数据看,Qwen-UI-Agent在多项基准测试中刷新了记录。
在移动端,Qwen-UI-Agent的测试成绩显著领先于业界主流模型。其中,MobileWorld基准得分82.1%,相比GPT-5.6 Sol、Claude Opus 4.8和Seed 2.1 Pro,分别高出12.0、14.6和8.9个百分点。真机测试MobileWorld-Real得分92.2%,超越了Gemini 3.1 Pro等竞品。而针对安卓应用的AndroidDaily测试得分高达97.5%,接近满分。这表明模型在移动应用操作上的准确性已接近人类水平。
电脑端的测试同样显示其在任务完成度和效率上的优势。OSWorld-Verified基准得分79.5%,超过GPT-5.5、Gemini 3.1 Pro和Seed 2.1 Pro。在OSWorld-v2 Partial分数达到40.0%的同时,相比基线节省了58%的执行步数。这意味着模型不仅能处理复杂任务,还可以用更少的步骤完成目标,提升实际效率。
这套性能表现的背后,是一套覆盖100多台真实手机、150多个应用的真机移动训练环境。这种设定让模型从实际交互场景中学习,而非仅依赖模拟数据,有助于提升泛化能力。GUI智能体让模型从被动响应指令转向主动操作界面,拓展了AI的应用边界,阿里此次发布也展示了其在多模态AI领域的技术积累。不过,基准测试成绩到稳定的产品落地仍需时间,模型在复杂环境中的长期适应性有待进一步观察。



