中文

如何通过辅助推理 unleash GUI Grounding in VLMs

计算机视觉与模式识别 2025-09-16 v1

摘要

图形用户界面 (GUI) grounding 是构建 GUI 智能体的基本任务。然而,通用视觉语言模型 (VLMs) 由于缺乏特定优化,难以完成此任务。我们指出本文中的关键差距:尽管 VLMs 在点游戏等指标衡量下展现出显著的潜在 grounding 能力,但在输出显式坐标时表现不佳。为此,我们提出三种零样本辅助推理方法。通过在输入图像中提供显式空间线索(如坐标轴、网格和标记交点),这些方法使 VLMs 能够表达其隐式的空间理解能力。我们在四个 GUI grounding 基准测试中评估了这些方法,涵盖七个开源和商业 VLMs。评估结果表明,所提方法显著提升了 GUI grounding 的性能。

关键词

引用

@article{arxiv.2509.11548,
  title  = {How Auxiliary Reasoning Unleashes GUI Grounding in VLMs},
  author = {Weiming Li and Yan Shao and Jing Yang and Yujing Lu and Ling Zhong and Yuhan Wang and Manni Duan},
  journal= {arXiv preprint arXiv:2509.11548},
  year   = {2025}
}