中文

像人类一样导航数字世界:面向GUI智能体的通用视觉定位

人工智能 2025-06-18 v3 计算与语言 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)正在改变图形用户界面(GUI)智能体的能力,促进它们从受控模拟向跨各种平台的复杂现实世界应用过渡。然而,这些智能体的有效性取决于其定位能力的稳健性。当前的GUI智能体主要使用基于文本的表示,如HTML或无障碍树,尽管这些表示有用,但常常引入噪声、不完整性和增加的计算开销。在本文中,我们提倡为GUI智能体采用类似人类的具身方式,即完全视觉地感知环境,并直接在GUI上执行像素级操作。关键在于视觉定位模型,该模型能够将GUI元素的各种指代表达准确映射到不同平台上GUI上的坐标。我们表明,一个简单的方案,包括基于网络的合成数据和对LLaVA架构的轻微调整,对于训练此类视觉定位模型出奇地有效。我们收集了迄今为止最大的GUI视觉定位数据集,包含超过130万张截图上的1000万个GUI元素及其指代表达,并用它来训练UGround,一个用于GUI智能体的强大通用视觉定位模型。在跨越三个类别(定位、离线智能体和在线智能体)的六个基准测试上的实证结果表明:1)UGround显著优于现有的用于GUI智能体的视觉定位模型,绝对性能提升高达20%;2)配备UGround的智能体优于最先进的智能体,尽管现有智能体使用额外的基于文本的输入,而我们的智能体仅使用视觉感知。这些结果为像人类一样导航数字世界的GUI智能体的可行性和前景提供了有力支持。

关键词

引用

@article{arxiv.2410.05243,
  title  = {Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents},
  author = {Boyu Gou and Ruohan Wang and Boyuan Zheng and Yanan Xie and Cheng Chang and Yiheng Shu and Huan Sun and Yu Su},
  journal= {arXiv preprint arXiv:2410.05243},
  year   = {2025}
}

备注

Accepted to ICLR 2025 (Oral). Project Homepage: https://osu-nlp-group.github.io/UGround/