中文

基于区域一致性的 GUI grounding 测试时强化学习

计算机视觉与模式识别 2025-11-14 v2 人工智能 计算与语言

摘要

Graphical User Interface(GUI)grounding 是将自然语言指令映射到精确屏幕坐标的任务,是自主 GUI 代理的基础。虽然现有方法通过大量监督训练或使用带标签奖励的强化学习实现了良好性能,但受限于像素级标注的成本和获取难度。我们观察到,当模型生成同一 GUI 元素的多个预测时,空间重叠模式揭示了可指导更准确局部化的隐式置信信号。基于此洞察,我们提出了GUI-RC(Region Consistency),一种测试时扩展方法,通过构建空间投票网格来识别模型显示最高一致性的共识区域。无需任何训练,GUI-RC在ScreenSpot基准测试中各种架构上提高了2-3%的准确率。我们进一步引入GUI-RCPO(Region Consistency Policy Optimization),将这些一致性模式转化为测试时强化学习的奖励。通过计算每个预测与整个共识的对齐程度,GUI-RCPO使模型能够在推理期间对无标签数据进行迭代细化。广泛的实验表明,我们的方法具有普适性:仅使用1272个无标签数据,GUI-RCPO在ScreenSpot基准测试中各种架构上实现了3-6%的准确率提升。我们的方法揭示了测试时扩展和测试时强化学习在 GUI grounding 中未被充分发掘的潜力,为更高效的数据驱动 GUI 代理提供了可行路径。

关键词

引用

@article{arxiv.2508.05615,
  title  = {Test-Time Reinforcement Learning for GUI Grounding via Region Consistency},
  author = {Yong Du and Yuchen Yan and Fei Tang and Zhengxi Lu and Chang Zong and Weiming Lu and Shengpei Jiang and Yongliang Shen},
  journal= {arXiv preprint arXiv:2508.05615},
  year   = {2025}
}

备注

[Accepted by AAAI2026] Project Page: https://zju-real.github.io/gui-rcpo Code: https://github.com/zju-real/gui-rcpo