中文

通过自批判强化学习提升可信GUI grounding

计算机视觉与模式识别 2026-05-28 v2

摘要

自动化图形用户界面 (GUI) 代理依赖准确的GUI grounding 技术,即将语言指令映射到屏幕坐标,以执行用户命令。然而,当前模型无论通过监督微调 (SFT) 还是强化学习 (RL) 训练,都常提供与实际grounding正确性不匹配的置信度信号,导致过度自信且不可靠的预测。为此,我们提出HyperClick,一种通过自批判强化学习 (SCRL) 提升可信GUI grounding 的新型框架。HyperClick 结合正确性奖励和置信度对齐奖励,训练策略模型同时输出点击预测和显式置信度估计。该方法通过置信度自评 jointly 优化grounding准确性和置信度可靠性。大量在具有挑战性基准测试上的实验表明,HyperClick 在保持强大grounding性能的同时,提供更匹配的置信度估计。通过暴露不确定性及GUI动作,HyperClick 支持置信度基础的GUI自动化回避。代码将在此公开。

关键词

引用

@article{arxiv.2510.27266,
  title  = {Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning},
  author = {Shaojie Zhang and Pei Fu and Ruoceng Zhang and Jiahui Yang and Anan Du and Xiuwen Xi and Shaokang Wang and Ying Huang and Bin Qin and Zhenbo Luo and Jian Luan},
  journal= {arXiv preprint arXiv:2510.27266},
  year   = {2026}
}