GuirlVG:通过基于经验的强化学习激励 GUI 视觉定位
人工智能
2025-08-07 v1
摘要
图形用户界面视觉定位(GUI-VG)是 GUI 智能体的核心能力,主要依赖于多模态大语言模型(MLLM)的监督微调(SFT),这需要大量数据 curated 以及巨大的训练成本。然而,随着 MLLM 的不断进步甚至在预训练中覆盖 GUI 领域,针对性的 SFT 后训练的必要性日益存疑。同时,最近基于规则的强化微调(RFT)的成功表明,这是一种更高效的替代方案。尽管如此,针对 GUI-VG 应用 RFT 的最佳方式仍未探索。为弥合这一差距,我们引入 GuirlVG,这是一种基于系统经验研究和 novel stabilization 技术的强化学习-based GUI-VG 方法。我们发现,naive 应用 RFT 的性能不如 SFT 基线,这促使我们进行更深入的探索。首先,我们将 RFT 分解为其核心组件并分析每个组件的最佳公式。其次,我们提出一种新的对抗性 KL 因子,用于动态稳定训练以缓解奖励过度优化。最后,我们进一步探索 RFT 的训练配置以提高有效性。广泛的实验表明,GuirlVG 只需 5.2K 训练样本,便超过了在 10M 以上样本上训练的 SFT 方法,在 ScreenSpot 上实现 7.7% 的提升,在 ScreenSpotPro 上实现 17.2% 的提升,并在 ScreenSpotV2 上达到 91.9% 的准确率。
关键词
引用
@article{arxiv.2508.04389,
title = {GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning},
author = {Weitai Kang and Bin Lei and Gaowen Liu and Caiwen Ding and Yan Yan},
journal= {arXiv preprint arXiv:2508.04389},
year = {2025}
}
备注
9 pages