中文

从自身学习点击位置:基于强化学习的 GUI grounding 自蒸馏

人工智能 2026-05-12 v3 计算机视觉与模式识别

摘要

图形用户界面(GUI)grounding 将自然语言指令映射到目标元素的视觉坐标,是自主 GUI 代理的核心能力。最近的强化学习方法(如 GRPO)取得了强大的性能,但依赖于高成本的多次 rollout,并在困难样本上存在稀疏信号。这些限制使得基于单次 rollout 提供稠密 token 级监督的基于策略的自蒸馏(OPSD)成为有前景的替代方案。然而,其对 GUI grounding 的适用性尚未探索。本文提出 GUI-SD,即第一个为 GUI grounding 量身定制的 OPSD 框架。首先,它利用目标边界框和高斯软掩码构建视觉丰富化的特权上下文,提供信息性指导而不泄露确切坐标。其次,它采用熵导向蒸馏,根据数字重要性和教师置信度自适应加权 token,将优化集中于最具影响力且最可靠的位置。对六个代表性 GUI grounding 基准进行大量实验,表明 GUI-SD 在准确率和训练效率方面均一致优于基于 GRPO 的方法以及朴素的 OPSD。代码和训练数据已提供。

关键词

引用

@article{arxiv.2605.00642,
  title  = {Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding},
  author = {Yan Zhang and Daiqing Wu and Huawen Shen and Can Ma and Yu Zhou},
  journal= {arXiv preprint arXiv:2605.00642},
  year   = {2026}
}

备注

under review