中文

Aria-UI:GUI 指令的视觉对齐

人机交互 2025-07-09 v2 人工智能

摘要

通过直接操作 GUI 实现跨平台自动化任务的数字代理日益重要。对于这些代理,语言指令到目标元素的对齐仍是一个显著的挑战,由于依赖于 HTML 或 AXTree 输入。在本文中,我们引入 Aria-UI,一个专为 GUI 对齐设计的大型多模态模型。Aria-UI 采用纯视觉方法,摆脱对辅助输入的依赖。为适应异构规划指令,我们提出了可扩展的数据管道,用于合成多样且高质量的 grounding 指令样本。为处理任务执行中的动态上下文,Aria-UI 融合了文本和文本-图像交错的动作历史,实现对 grounding 的稳健的上下文感知推理。Aria-UI 在离线和在线 agent 基准测试中均取得了新的最先进成绩,超越了基于视觉的方法和依赖 AXTree 的方法。我们发布了所有训练数据和模型检查点,以鼓励进一步的研究,访问地址为 https://ariaui.github.io。

关键词

引用

@article{arxiv.2412.16256,
  title  = {Aria-UI: Visual Grounding for GUI Instructions},
  author = {Yuhao Yang and Yue Wang and Dongxu Li and Ziyang Luo and Bei Chen and Chao Huang and Junnan Li},
  journal= {arXiv preprint arXiv:2412.16256},
  year   = {2025}
}

备注

ACL 2025