GUI-G1:理解 GUI 智能体中视觉定位的类 R1-Zero 训练
计算与语言
2025-05-23 v2 人工智能
计算机视觉与模式识别
摘要
最近的图形用户界面 (GUI) 智能体复制了 R1-Zero 范式,将在线强化学习 (RL) 与目标定位前的显式链思维推理相结合,从而实现了显著的性能提升。在本文中,我们首先对该训练流程的三个关键组成部分进行了广泛的分析实验:输入设计、输出评估和策略更新——每个部分都揭示了因盲目应用通用 RL 而不适应 GUI 定位任务而产生的独特挑战。输入设计:当前的模板鼓励模型生成链思维推理,但更长的推理链反而导致更差的定位性能。输出评估:基于命中信号或框面积的奖励函数允许模型利用框的大小,导致奖励黑客行为和较差的定位质量。策略更新:由于长度和样本难度的偏差,在线 RL 倾向于过拟合简单示例,导致在更难案例上的优化不足。为了解决这些问题,我们提出了三种有针对性的解决方案。首先,我们采用了一种快速思考模板,鼓励直接生成答案,从而减少训练期间的过度推理。其次,我们在奖励函数中加入框大小约束以缓解奖励黑客行为。第三,我们通过调整长度归一化并添加难度感知缩放因子来修正 RL 目标,从而能够更好地优化困难样本。我们的 GUI-G1-3B 模型,基于 Qwen2.5-VL-3B-Instruct 并使用 17K 公开样本进行训练,在 ScreenSpot 上达到了 90.3% 的准确率,在 ScreenSpot-Pro 上达到了 37.1% 的准确率。这超越了所有先前类似尺寸的模型,甚至优于更大的 UI-TARS-7B,在 GUI 智能体定位领域建立了新的最优水平。项目代码库可在 https://github.com/Yuqi-Zhou/GUI-G1 获取。
引用
@article{arxiv.2505.15810,
title = {GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents},
author = {Yuqi Zhou and Sunhao Dai and Shuai Wang and Kaiwen Zhou and Qinglin Jia and Jun Xu},
journal= {arXiv preprint arXiv:2505.15810},
year = {2025}
}