中文

强化 UI 指令定位:迈向通用 UI 任务自动化 API

计算机视觉与模式识别 2023-10-10 v1

摘要

近期大语言模型(LLM)的流行开启了通过将 LLM 连接至各类领域特定模型或 API 来自动化众多 AI 任务的可能,其中 LLM 充当调度器,而领域特定模型或 API 作为动作执行器。尽管存在大量领域特定模型/API,它们在人与用户界面(UI)交互中仍难以全面覆盖极其多样的自动化需求。本工作中,我们构建了一个多模态模型,以在给定 UI 截图中定位自然语言指令,作为通用 UI 任务自动化执行器。该无元数据定位模型由视觉编码器与语言解码器组成,先在成熟的文档理解任务上预训练,再学习以可提示方式从 UI 截图中解码空间信息。为利用图像到文本的预训练知识,我们遵循像素到序列范式,使用语言解码器以令牌序列预测几何坐标。我们进一步提出一种基于强化学习(RL)的创新算法,以视觉语义度量联合监督该序列中的令牌,有效增强了像素到序列范式的空间解码能力。大量实验表明,我们提出的强化 UI 指令定位模型以明显优势优于最先进方法,并展现出作为通用 UI 任务自动化 API 的潜力。

关键词

引用

@article{arxiv.2310.04716,
  title  = {Reinforced UI Instruction Grounding: Towards a Generic UI Task Automation API},
  author = {Zhizheng Zhang and Wenxuan Xie and Xiaoyi Zhang and Yan Lu},
  journal= {arXiv preprint arXiv:2310.04716},
  year   = {2023}
}