Screen2Words:基于多模态学习的移动端界面自动摘要
人机交互
2021-08-10 v1 人工智能
机器学习
摘要
移动用户界面摘要生成简洁的语言描述以传达屏幕的重要内容与功能,可用于许多基于语言的应用场景。我们提出 Screen2Words,一种新颖的屏幕摘要方法,可自动将 UI 屏幕的本质信息封装为连贯的语言短语。移动屏幕摘要需要对移动 UI 的多模态数据(包括文本、图像、结构以及 UI 语义)有整体理解,这促使我们采用多模态学习方法。我们收集并分析了由人工标注的大规模屏幕摘要数据集。我们的数据集包含超过 112k 条语言摘要,覆盖约 22k 个独特 UI 屏幕。随后我们实验了一系列具有不同配置的深度学习模型。通过自动准确率指标和人工评分对这些模型的评估表明,我们的方法能为移动屏幕生成高质量摘要。我们展示了 Screen2Words 的潜在用例,并开源我们的数据集与模型,为进一步桥接语言与用户界面奠定基础。
引用
@article{arxiv.2108.03353,
title = {Screen2Words: Automatic Mobile UI Summarization with Multimodal Learning},
author = {Bryan Wang and Gang Li and Xin Zhou and Zhourong Chen and Tovi Grossman and Yang Li},
journal= {arXiv preprint arXiv:2108.03353},
year = {2021}
}
备注
UIST'21