中文

UI-R1: 通过强化学习提升 GUI 智能体的高效动作预测

人工智能 2025-05-27 v5

摘要

最近的 DeepSeek-R1 通过基于规则奖励的强化学习(RL)展示了大语言模型(LLM)推理能力的出现。尽管其在语言模型方面的成功显而易见,但在多模态领域,特别是图形用户界面(GUI)智能体任务中,应用仍属under-explored。为此,我们提出 UI-R1,即第一个探索基于规则 RL 如何提升多模态大语言模型(MLLM)用于 GUI 动作预测任务推理能力的框架。具体而言,UI-R1 引入一种新颖的基于规则的动作奖励,使模型可通过基于策略的算法(如 Group Relative Policy Optimization, GRPO)进行优化。为实现高效训练,我们精选了一个小而高质量的 136 个具有挑战性的任务数据集,涵盖移动设备上的五种常见动作类型。实验结果表明,我们提出的 UI-R1-3B 在 both in-domain(ID)和 out-of-domain(OOD)任务上均显著优于 base model(即 Qwen2.5-VL-3B),在 ScreenSpot、ScreenSpot-Pro 和 ANDROIDCONTROL 上的平均准确率分别提升了 22.1%、6.0% 和 12.7%。此外,UI-R1-3B 交付的性能与更大规模的模型(例如通过在 76K 样本上进行监督微调(SFT)训练的 OS-Atlas-7B)相当。我们还开发了一个优化版本 UI-R1-E-3B,显著提高了 grounding 效率和准确性。这些结果凸显了基于规则强化学习在推进 GUI 理解和控制方面的潜力,为该领域的未来研究之路。

关键词

引用

@article{arxiv.2503.21620,
  title  = {UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning},
  author = {Zhengxi Lu and Yuxiang Chai and Yaxuan Guo and Xi Yin and Liang Liu and Hao Wang and Han Xiao and Shuai Ren and Guanjing Xiong and Hongsheng Li},
  journal= {arXiv preprint arXiv:2503.21620},
  year   = {2025}
}

备注

Updated UI-R1-E-3B