中文

TRISHUL: 面向大型 VLM 基于 GUI 智能体的区域识别与屏幕层级理解

计算机视觉与模式识别 2025-02-17 v2 人工智能 机器学习

摘要

近期大型视觉语言模型 (LVLMs) 的进展已使开发基于 LVLMs 的图形用户界面 (GUI) 智能体成为可能,采取多种范式。在训练方法(如 CogAgent 和 SeeClick)方面,由于依赖于数据集特定的训练,难以实现跨数据集和跨平台的泛化。通用 LVLMs(如 GPT-4V)采用集合标记 (SoM) 用于动作锚定,但获取 SoM 标签需要诸如 HTML 源等 metadata,而这些 metadata 在不同平台上并非一致可用。此外,现有方法常只专注于单一 GUI 任务,而难以实现全面的 GUI 理解。为了克服这些限制,我们引入 TRISHUL,一种新型、无训练的 agentic 框架,用于增强通用 LVLMs 以实现全面 GUI 理解。与先前的工作不同,TRISHUL 融合了动作锚定(将指令映射到 GUI 元素)和 GUI 指代(给定位置描述 GUI 元素)两种功能。其核心,TRISHUL 采用层次屏幕解析 (HSP) 和空间增强元素描述 (SEED) 模块,这两者协同工作,提供 GUI 元素的多粒度、空间和语义丰富表示。我们的结果表明,TRISHUL 在 ScreenSpot、VisualWebBench、AITW 和 Mind2Web 数据集上在动作锚定方面表现优异。此外,对于 GUI 指代,TRISHUL 在 ScreenPR 数据集上超越了 ToL 智能体,为稳健且可适应的 GUI 理解树立了新标准。

关键词

引用

@article{arxiv.2502.08226,
  title  = {TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents},
  author = {Kunal Singh and Shreyas Singh and Mukund Khanna},
  journal= {arXiv preprint arXiv:2502.08226},
  year   = {2025}
}

备注

8 pages 5 figures