中文

GUI-Shepherd:可靠的长序列 GUI 任务过程奖励与验证

人工智能 2025-09-30 v1

摘要

针对长序列图形用户界面任务的自主智能体受限于奖励稀疏和信用分配问题的不可解性,本文引入 GUI-Shepherd,一种过程奖励模型,提供逐步稠密反馈以引导智能体。GUI-Shepherd 基于 5.2 万组包含人工标注评分和 GPT-4o 生成论证的多样化大规模数据集进行训练,既可作为 RL 训练的奖励提供者,也可作为推理时的验证器。迄今为止,我们是首次系统研究 GUI 智能体中的过程监督,涵盖从在线长期任务到离线单步预测等多种场景。在在线 AndroidWorld 基准测试中,GUI-Shepherd 通过多轮在线 PPO 将成功率提升 7.7 分,显著优于基于结果奖励模型的竞争方法。作为推理验证器使用时,可带来 5.1 分的提升。该效果在离线 AndroidControl 基准测试中也能推广,作为奖励提供者提升 2.2 分,作为验证器提升 4.3 分。总体而言,我们的结果表明,高保真度过程监督对构建更强大的 GUI 智能体至关重要,并提出了可通用化的解决方案。

关键词

引用

@article{arxiv.2509.23738,
  title  = {GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks},
  author = {Cong Chen and Kaixiang Ji and Hao Zhong and Muzhi Zhu and Anzhou Li and Guo Gan and Ziyuan Huang and Cheng Zou and Jiajia Liu and Jingdong Chen and Hao Chen and Chunhua Shen},
  journal= {arXiv preprint arXiv:2509.23738},
  year   = {2025}
}