中文

屏幕识别:从像素为移动应用创建无障碍元数据

人机交互 2021-01-14 v1

摘要

移动平台上许多可用的无障碍功能要求应用程序( apps)提供完整且准确的描述用户界面(UI)组件的元数据。遗憾的是,许多应用并未提供充分的元数据以使无障碍功能按预期工作。本文中,我们探索从移动应用的像素推断其无障碍元数据,因为视觉界面往往最能反映应用的完整功能。我们训练了一个鲁棒、快速、内存高效的设备端模型,使用我们收集并标注的来自 4,068 个 iPhone 应用的 77,637 张屏幕的数据集来检测 UI 元素。为了进一步改进 UI 检测并添加语义信息,我们引入了启发式方法(例如 UI 分组与排序)和附加模型(例如识别 UI 内容、状态、可交互性)。我们构建了 Screen Recognition 来生成无障碍元数据以增强 iOS VoiceOver。在一项有 9 名屏幕阅读器用户参与的研究中,我们验证了我们的方法改善了现有移动应用的无障碍性,使甚至先前不可访问的应用也能被使用。

关键词

引用

@article{arxiv.2101.04893,
  title  = {Screen Recognition: Creating Accessibility Metadata for Mobile Applications from Pixels},
  author = {Xiaoyi Zhang and Lilian de Greef and Amanda Swearngin and Samuel White and Kyle Murray and Lisa Yu and Qi Shan and Jeffrey Nichols and Jason Wu and Chris Fleizach and Aaron Everitt and Jeffrey P. Bigham},
  journal= {arXiv preprint arXiv:2101.04893},
  year   = {2021}
}