面向移动应用的多模态图标标注
计算机视觉与模式识别
2021-07-12 v1 人工智能
人机交互
摘要
对用户界面的标注(即在屏幕上定位并分类有意义的 UI 元素)是屏幕阅读器和设备语音控制等许多移动应用的关键步骤。由于屏幕上缺乏显式标签、与图片相似以及形状多样,标注菜单、搜索、后退箭头等对象图标尤其具有挑战性。现有研究或使用视图层级(view hierarchy)或使用基于像素的方法来应对该任务。基于像素的方法更为流行,因为移动平台上的视图层级特征常常不完整或不准确,但这种方法忽略了视图层级中的指示性信息,如 resource-id 或内容描述。我们提出了一种新颖的基于深度学习的多模态方法,它结合了像素与视图层级特征的优点,并利用最先进的目标检测技术。为展示其效用,我们通过手动标注 Rico(一个由 72k 张 UI 截图组成的大规模移动设计数据集)中最常用的 29 个图标,构建了一个高质量的 UI 数据集。实验结果表明了我们的多模态方法的有效性。我们的模型不仅优于广泛使用的对象分类基线,也优于基于像素的目标检测模型。我们的研究揭示了如何结合视图层级与像素特征来标注 UI 元素。
引用
@article{arxiv.2107.04452,
title = {Multimodal Icon Annotation For Mobile Applications},
author = {Xiaoxue Zang and Ying Xu and Jindong Chen},
journal= {arXiv preprint arXiv:2107.04452},
year = {2021}
}
备注
11 pages, MobileHCI 2021