中文

面向移动应用的多模态图标标注

计算机视觉与模式识别 2021-07-12 v1 人工智能 人机交互

摘要

对用户界面的标注(即在屏幕上定位并分类有意义的 UI 元素)是屏幕阅读器和设备语音控制等许多移动应用的关键步骤。由于屏幕上缺乏显式标签、与图片相似以及形状多样,标注菜单、搜索、后退箭头等对象图标尤其具有挑战性。现有研究或使用视图层级(view hierarchy)或使用基于像素的方法来应对该任务。基于像素的方法更为流行,因为移动平台上的视图层级特征常常不完整或不准确,但这种方法忽略了视图层级中的指示性信息,如 resource-id 或内容描述。我们提出了一种新颖的基于深度学习的多模态方法,它结合了像素与视图层级特征的优点,并利用最先进的目标检测技术。为展示其效用,我们通过手动标注 Rico(一个由 72k 张 UI 截图组成的大规模移动设计数据集)中最常用的 29 个图标,构建了一个高质量的 UI 数据集。实验结果表明了我们的多模态方法的有效性。我们的模型不仅优于广泛使用的对象分类基线,也优于基于像素的目标检测模型。我们的研究揭示了如何结合视图层级与像素特征来标注 UI 元素。

关键词

引用

@article{arxiv.2107.04452,
  title  = {Multimodal Icon Annotation For Mobile Applications},
  author = {Xiaoxue Zang and Ying Xu and Jindong Chen},
  journal= {arXiv preprint arXiv:2107.04452},
  year   = {2021}
}

备注

11 pages, MobileHCI 2021