ProgRM:通过进度奖励构建更好的GUI智能体
人工智能
2025-05-26 v1 计算与语言
机器学习
摘要
基于大语言模型(LLM)的图形用户界面(GUI)智能体有望显著改变我们的日常生活。然而,当前的基于 LLM 的 GUI 智能体由于轨迹收集和奖励标注的困难,面临高质量训练数据稀缺的问题。现有工作一直在探索使用 LLM 收集轨迹用于模仿学习,或提供在线 RL 训练的奖励信号。然而,现有工作中使用的结果奖励模型(ORM)无法提供细粒度的反馈,并且可能会过度惩罚最终失败轨迹中的有价值步骤。为此,我们提出了进度奖励模型(ProgRM),通过预测在线训练中每个步骤的任务完成进度来提供密集的信息性中间奖励。为了应对进度奖励标签标注的挑战,我们进一步设计了一种高效的基于最长公共子序列(LCS)的自标注算法,以发现轨迹中的关键步骤并相应地分配进度标签。ProgRM 经过广泛的实验和分析进行评估。使用 ProgRM 训练的智能体优于领先的专有 LLM 和 ORM 训练的智能体,证明了 ProgRM 的有效性。实验代码将在接受后公开发布。
引用
@article{arxiv.2505.18121,
title = {ProgRM: Build Better GUI Agents with Progress Rewards},
author = {Danyang Zhang and Situo Zhang and Ziyue Yang and Zichen Zhu and Zihan Zhao and Ruisheng Cao and Lu Chen and Kai Yu},
journal= {arXiv preprint arXiv:2505.18121},
year = {2025}
}