中文

面向 GUI 智能体的自适应里程碑奖励

机器学习 2026-02-13 v1 人工智能 计算与语言

摘要

强化学习(RL)已成为训练移动 GUI 智能体的主流范式,但在处理长期任务固有的时序信任分配问题方面仍面临挑战。主要挑战在于奖励保真度与稠密度之间的权衡:结果奖励提供高保真度但信号稀疏,而过程奖励提供稠密监督但容易受偏差和奖励作弊的影响。为解决这一冲突,我们提出了自适应里程碑奖励(ADMIRE)机制。ADMIRE 通过将轨迹锚定到里程碑来构建可验证、自适应的奖励系统,其中里程碑从成功探索中动态提炼。关键在于,ADMIRE 集成了一种非对称信任分配策略,对成功轨迹进行去噪,对失败轨迹进行支架化处理。广泛的实验表明,ADMIRE 在 AndroidWorld 上基于不同基础模型上始终实现超过 10% 的成功率提升。此外,该方法在 diverse RL 算法和异构环境(如网页导航和具身任务)中表现出强大的通用性。

关键词

引用

@article{arxiv.2602.11524,
  title  = {Adaptive Milestone Reward for GUI Agents},
  author = {Congmin Zheng and Xiaoyun Mo and Xinbei Ma and Qiqiang Lin and Yin Zhao and Jiachen Zhu and Xingyu Lou and Jun Wang and Zhaoxiang Wang and Weiwen Liu and Zhuosheng Zhang and Yong Yu and Weinan Zhang},
  journal= {arXiv preprint arXiv:2602.11524},
  year   = {2026}
}