GUI-Actor:面向 GUI 智能体的无坐标视觉定位
计算与语言
2025-06-04 v1 人工智能
计算机视觉与模式识别
摘要
构建基于 VLM 的 GUI 智能体所面临的主要挑战之一是视觉定位,即根据视觉内容和文本计划定位适合执行操作的屏幕区域。现有工作大多将其形式化为基于文本的坐标生成任务。然而,这些方法存在若干局限:空间-语义对齐弱、无法处理模糊的监督目标,以及屏幕坐标的密集性与 Vision Transformers 等模型提取的视觉特征的块级粗粒度之间存在不匹配。本文提出 GUI-Actor,一种用于无坐标 GUI 定位的基于 VLM 的方法。GUI-Actor 的核心是引入一个基于注意力的动作头,该动作头学习将一个专用的 <ACTOR> token 与所有相关的视觉块标记对齐,使模型能够在单次前向传播中提出一个或多个动作区域。在此基础上,我们进一步设计了定位验证器,用于评估并从为动作执行提出的候选区域中选出最可信的动作区域。大量实验表明,GUI-Actor 在多个 GUI 动作定位基准上优于先前最先进方法,在未见过的屏幕分辨率和布局上具有更强的泛化能力。值得注意的是,GUI-Actor-7B 在 ScreenSpot-Pro 上甚至超越了 UI-TARS-72B(38.1),以 Qwen2-VL 和 Qwen2.5-VL 作为骨干网络分别取得了 40.7 和 44.6 的分数。此外,通过引入验证器,我们发现仅微调新引入的动作头(7B 模型约 1 亿参数)并保持 VLM 骨干网络冻结,即可达到与先前最先进模型相当的性能,这表明 GUI-Actor 能够在不损害底层 VLM 通用能力的前提下赋予其有效的定位能力。
引用
@article{arxiv.2506.03143,
title = {GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents},
author = {Qianhui Wu and Kanzhi Cheng and Rui Yang and Chaoyun Zhang and Jianwei Yang and Huiqiang Jiang and Jian Mu and Baolin Peng and Bo Qiao and Reuben Tan and Si Qin and Lars Liden and Qingwei Lin and Huan Zhang and Tong Zhang and Jianbing Zhang and Dongmei Zhang and Jianfeng Gao},
journal= {arXiv preprint arXiv:2506.03143},
year = {2025}
}