中文

通用扫描器遇见专用定位器:用于鲁棒 GUI 定位的协同粗到细框架

计算机视觉与模式识别 2025-09-30 v1 计算与语言

摘要

在图形用户界面(GUI)中定位自然语言查询是一项具有挑战性的任务,要求模型理解各种应用程序和系统中的多样化 UI 元素,同时准确预测目标操作的空间坐标。为了解决这个问题,我们提出了 GMS:通用扫描器遇见专用定位器,一个协同的粗到细框架,有效提升了 GUI 定位性能。GMS 利用通用视觉语言模型(VLM)和小型、任务特定的 GUI 定位模型的互补优势,在框架中为它们分配不同角色。具体而言,通用 VLM 充当'扫描器'来识别潜在的兴趣区域,而微调的定位模型充当'定位器',在这些区域内输出精确坐标。这一设计灵感来源于人类执行 GUI 定位的方式,其中眼睛扫描界面,大脑专注于解释和定位。我们的整个框架包含五个阶段,并融合了层次化搜索与跨模态通信以实现有前景的预测结果。在 ScreenSpot-Pro 数据集上的实验结果表明,虽然'扫描器'和'定位器'模型独立使用时分别仅达到 2.0% 和 3.7% 的准确率,但它们在 GMS 框架中的集成产生了 35.7% 的整体准确率,代表了 10 倍的提升。此外,GMS 在各种设置下显著优于其他强基线,证明了其鲁棒性和通用 GUI 定位的潜力。

关键词

引用

@article{arxiv.2509.24133,
  title  = {Generalist Scanner Meets Specialist Locator: A Synergistic Coarse-to-Fine Framework for Robust GUI Grounding},
  author = {Zhecheng Li and Guoxian Song and Yiwei Wang and Zhen Xiong and Junsong Yuan and Yujun Cai},
  journal= {arXiv preprint arXiv:2509.24133},
  year   = {2025}
}