AndroidControl-Curated:通过基准测试净化揭示 GUI 智能体的真实潜力
人工智能
2025-10-22 v1 软件工程
摘要
类似 Siri 和 Google Assistant 的设备端虚拟助手日益重要,但其能力受限于依赖严格、开发者依赖的 API。GUI 智能体提供一种强大的、独立于 API 的替代方案,但由于被认为性能较差(即使最佳模型如 Qwen3-VL-235B 在 AndroidControl 等基准测试中得分仅约60%),其实际应用仍受阻。我们的研究表明,问题不仅在于模型本身,也在于基准测试本身。我们发现 AndroidControl 存在若干显著缺陷,包括歧义和事实错误,系统性地低估了智能体的能力。为解决这一关键问题,我们通过严格的净化流程提升了 AndroidControl,构建了改进版 AndroidControl-Curated。 在该增强基准上,最新模型的成功率提升至接近75%(复杂任务提升约15%),表明设备端 GUI 智能体实际上已接近实际部署的临界点。我们引入新的 SOTA 模型 Magma-R1-3B,通过仅使用 2400 个精心挑选的样本进行 post-training,耗用约60小时的 H20 GPU(约60美元),即可达到与 Qwen3-VL-235B 相当的性能。尽管参数规模是其200倍,此模型仍能提供与之相当的表现。我们将 AndroidControl-Curated 基准和 Magma-R1 模型均发布给研究社区,鼓励采用这一增强版基准以更准确地反映模型能力,加速面向实用化的设备端虚拟助手的开发。
引用
@article{arxiv.2510.18488,
title = {AndroidControl-Curated: Revealing the True Potential of GUI Agents through Benchmark Purification},
author = {Ho Fai Leung and Xiaoyan Xi and Fei Zuo},
journal= {arXiv preprint arXiv:2510.18488},
year = {2025}
}