中文

V2P:基于背景抑制和中心放大的 GUI grounding 视觉注意力校准

人工智能 2026-01-19 v2

摘要

GUI 元素的精确定位是 GUI agent 开发的关键。传统方法依赖边界框或中心点回归,忽略了空间交互不确定性和视觉-语义层次结构。最近的方法引入注意力机制,但仍面临两个关键问题:(1) 忽略处理背景区域导致注意力偏离目标区域,(2) 统一建模目标 UI 元素无法区分其中心和边缘,导致点击不精确。受人类视觉处理和交互 GUI 元素的方式启发,我们提出了 Valley-to-Peak (V2P) 方法以解决这些问题。为缓解背景干扰,V2P 引入抑制注意力机制,以最小化模型对不相关区域的关注以突出目标区域。对于中心-边缘区分问题,V2P 采用类似 Fitts 定律的方法,将 GUI 交互建模为 2D 高斯热图,其中权重从中心逐渐减小到边缘。权重分布遵循高斯函数,方差由目标大小决定。因此,V2P 有效隔离目标区域并教会模型集中于 UI 元素的最关键点。由 V2P 训练的模型在两个基准 ScreenSpot-v2 和 ScreenSpot-Pro 上分别达到 92.4% 和 52.5% 的性能 (见 Fig.\\ref{fig:main_results_charts})。消融实验进一步确认每个组件的贡献,凸显 V2P 在精确 GUI grounding 任务中的通用性及其在未来 GUI agent 中的潜在部署价值。

关键词

引用

@article{arxiv.2601.06899,
  title  = {V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking},
  author = {Jikai Chen and Long Chen and Dong Wang and Qinglin Su and Zhixuan Chu and Bingguang Hao and Leilei Gan and Chenyi Zhuang and Jinjie Gu},
  journal= {arXiv preprint arXiv:2601.06899},
  year   = {2026}
}

备注

This work was intended as a replacement of arXiv:2508.13634 and any subsequent updates will appear there