中文

面向移动 GUI 导航的视觉-语言智能体的规模化、基准测试与推理

人工智能 2026-05-27 v1

摘要

视觉-语言模型(VLMs)在移动 GUI 导航方面显示出快速的进展。本文present了一项针对基于VLMs的智能体在该领域进行数据规模化、基准测试和推理的系统性研究。为facilitate严格的评估,我们引入HyperTrack,一个拥有超过16000个真实世界任务的大规模数据集,覆盖超过650个中国移动应用,并开发GUIEvalKit,一个用于统一评估VLMs在离线 GUI 导航任务上的基准测试的开源工具包。使用HyperTrack,我们分析了训练数据规模对监督式和基于强化学习的微调的影响。我们的結果显示,基于强化学习的微调在监督式微调中始终表现更好,特别是在超出域设置下,这突显了数据规模化与强化学习之间的协同作用。利用GUIEvalKit,我们进一步对最先进(SOTA)VLMs进行基准测试,并分析了交互历史和推理能力如何影响任务完成。总的来说,HyperTrack和GUIEvalKit为开发和评估移动 GUI 导航任务中的VLM智能体提供了一个全面的平台。

关键词

引用

@article{arxiv.2605.27134,
  title  = {Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation},
  author = {Heng Qu and Yike Liu and Renren Jin and Wenzong Zhang and Pengzhi Gao and Wei Liu and Jian Luan},
  journal= {arXiv preprint arXiv:2605.27134},
  year   = {2026}
}

备注

Accepted at ICML 2026