中文

ZeroGUI:以零人力成本自动化在线 GUI 学习

人工智能 2025-05-30 v1 计算与语言 计算机视觉与模式识别

摘要

大型视觉语言模型的快速发展推动了纯视觉 GUI Agent 的发展,使其能够感知并操作图形用户界面(GUI)以自主执行用户指令。然而,现有方法通常采用离线学习框架,面临两个核心局限:(1)严重依赖高质量的元素定位和动作监督的人工标注,以及(2)对动态和交互环境的适应性有限。为了解决这些局限,我们提出了 ZeroGUI,一个可扩展的在线学习框架,旨在以零人力成本自动化 GUI Agent 的训练。具体而言,ZeroGUI 集成了:(i)基于 VLM 的自动任务生成,从当前环境状态生成多样化的训练目标;(ii)基于 VLM 的自动奖励估计,无需人工设计的评估函数即可评估任务是否成功;以及(iii)两阶段在线强化学习,以持续与 GUI 环境交互并从中学习。在两个先进的 GUI Agent(UI-TARS 和 Aguvis)上的实验表明,ZeroGUI 在 OSWorld 和 AndroidLab 环境中显著提升了性能。代码可在 https://github.com/OpenGVLab/ZeroGUI 获取。

关键词

引用

@article{arxiv.2505.23762,
  title  = {ZeroGUI: Automating Online GUI Learning at Zero Human Cost},
  author = {Chenyu Yang and Shiqian Su and Shi Liu and Xuan Dong and Yue Yu and Weijie Su and Xuehui Wang and Zhaoyang Liu and Jinguo Zhu and Hao Li and Wenhai Wang and Yu Qiao and Xizhou Zhu and Jifeng Dai},
  journal= {arXiv preprint arXiv:2505.23762},
  year   = {2025}
}