Spotlight:基于聚焦视觉-语言模型的移动 UI 理解
计算机视觉与模式识别
2023-02-27 v4 人机交互
机器学习
摘要
移动 UI 理解对于实现 UI 自动化与无障碍等交互任务十分重要。以往的 mobile UI 建模常依赖屏幕的视图层级信息,其直接提供 UI 的结构化数据,以期绕过从屏幕像素进行视觉建模的难题。然而,视图层级并非总可用,且常因缺失对象描述或结构信息错位而受损。因此,尽管使用视图层级可带来短期收益,最终可能制约模型的适用性与性能。本文提出 Spotlight,一种仅依赖视觉的移动 UI 理解方法。具体而言,我们增强了一个视觉-语言模型,其仅以 UI 截图与屏幕上感兴趣区域——即聚焦——作为输入。Spotlight 的通用架构易于扩展,能够执行一系列 UI 建模任务。实验表明,我们的模型在若干代表性 UI 任务上确立了 SoTA 结果,并优于以往同时使用截图与视图层级作为输入的方法。此外,我们探索了所提模型的多任务学习与少样本提示能力,展示了在多任务学习方向上的 promising 结果。
引用
@article{arxiv.2209.14927,
title = {Spotlight: Mobile UI Understanding using Vision-Language Models with a Focus},
author = {Gang Li and Yang Li},
journal= {arXiv preprint arXiv:2209.14927},
year = {2023}
}
备注
Published as a conference paper at ICLR 2023