R-VLM:面向精确 GUI 定位的区域感知视觉语言模型
计算机视觉与模式识别
2025-07-09 v1
摘要
用于自动化人类在图形用户界面 (GUI) 上活动的视觉代理模型正成为一个引人注目的研究方向,这推动了大型视觉语言模型 (VLM) 的进步。GUI 自动化的关键挑战在于跨平台对界面元素的精确 grounding。现有的仅视觉的 GUI 代理直接从大型且杂乱的屏幕截图中 grounding 元素,需要处理大量无关信息,这会损害准确性。此外,这些方法通常采用基本的交叉熵损失来学习 grounding 目标,无法有效捕捉与像素交叉比 (IoU) 等 established object detection 指标相比较的 grounding 质量。为此,我们引入 R-VLM,一种新的 GUI grounding 方法,利用放大的区域提案实现精确的元素定位。我们还提出了一种受 IoU 启发的目标函数,以促进模型收敛于高 IoU 预测。我们的做法桥接了 VLM 与传统目标检测技术,使 GUI grounding benchmarks 中的 ScreenSpot 和 AgentStudio 跨 diverse GUI 平台的 grounding 准确率提高了 13%。此外,我们的 R-VLM 方法在 AITW 和 Mind2Web benchmarks 上的 GUI navigation 任务中显示出 3.2-9.7% 的绝对准确率提升。
关键词
引用
@article{arxiv.2507.05673,
title = {R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding},
author = {Joonhyung Park and Peng Tang and Sagnik Das and Srikar Appalaraju and Kunwar Yashraj Singh and R. Manmatha and Shabnam Ghadar},
journal= {arXiv preprint arXiv:2507.05673},
year = {2025}
}
备注
ACL 2025; 17 pages