中文

通过显式位置到坐标映射提升 GUI 基准性能

计算机视觉与模式识别 2025-10-06 v1 人工智能

摘要

GUI 基准是将自然语言指令映射到像素坐标的任务,对自主智能体至关重要,但当前视觉语言模型(VLM)在此方面仍存在困难。核心瓶颈在于可靠的 patch-to-pixel 映射,当 extrapolate 到训练期未见的高分辨率显示器时,此映射会失效。当前方法直接从视觉特征生成坐标文本标记,迫使模型隐式推断复杂的位置到像素映射;结果是在新分辨率上,准确率下降,故障激增。我们提出两种互补创新。首先,RULER 标记作为显式坐标标记,使模型能够类似地图上的网格线一样引用位置,进行调整而非从头生成坐标。其次,Interleaved MRoPE(I-MRoPE)改进了空间编码,确保宽高维度平等表示,解决了标准位置方案的不对称性。实验在 ScreenSpot、ScreenSpot-V2 和 ScreenSpot-Pro 上均显示出对高分辨率界面基准准确率的持续提升。在不依赖隐式学习、而是提供显式空间指导的同时,我们的方法在不同分辨率和平台上实现了更可靠的 GUI 自动化。

关键词

引用

@article{arxiv.2510.03230,
  title  = {Improving GUI Grounding with Explicit Position-to-Coordinate Mapping},
  author = {Suyuchen Wang and Tianyu Zhang and Ahmed Masry and Christopher Pal and Spandana Gella and Bang Liu and Perouz Taslakian},
  journal= {arXiv preprint arXiv:2510.03230},
  year   = {2025}
}