中文

理解移动端图形用户界面:从像素词到屏幕句

计算机视觉与模式识别 2022-04-15 v2 人机交互 多媒体

摘要

移动手机的普及使得移动端GUI理解成为一项重要任务。该领域以往多数工作需在推理时使用人工创建的屏幕元数据(如视图层次结构),遗憾的是此类元数据常不可用或不足以可靠支撑GUI理解。受Transformer在NLP任务中惊人成功的启发,面向纯基于视觉的GUI理解,我们将词/句的概念扩展为像素词/屏幕句,并提出一种移动端GUI理解架构:从像素词到屏幕句(PW2SS)。类比于独立的词,我们将像素词定义为原子视觉组件(文本与图形组件),其在多种设计风格的截图中视觉一致且语义清晰。从截图提取的像素词经所提屏幕Transformer聚合为屏幕句以建模其关系。由于像素词被定义为原子视觉组件,其视觉外观与语义间的歧义被大幅降低。我们得以利用训练数据中可用元数据自动生成像素词的高质量标注。基于公开RICO数据集构建了带像素词标注的截图数据集RICO-PW,将予以发布以缓解该领域高质量训练数据的匮乏。我们在该数据集上训练检测器从截图提取像素词,从而在推理时实现无元数据的GUI理解。实验表明像素词可在RICO-PW上被良好提取并泛化至我们自行收集的新数据集P2S-UI。PW2SS的有效性进一步在关系预测、可点击性预测、屏幕检索与app类型分类等GUI理解任务中得到验证。

关键词

引用

@article{arxiv.2105.11941,
  title  = {Understanding Mobile GUI: from Pixel-Words to Screen-Sentences},
  author = {Jingwen Fu and Xiaoyi Zhang and Yuwang Wang and Wenjun Zeng and Sam Yang and Grayson Hilliard},
  journal= {arXiv preprint arXiv:2105.11941},
  year   = {2022}
}