ScreenQA:面向移动应用截图的大规模问答对数据集
计算与语言
2025-02-11 v4 计算机视觉与模式识别
人机交互
摘要
我们介绍 ScreenQA,一个旨在通过问答推进屏幕内容理解的新基准数据集。现有屏幕数据集要么聚焦于低层结构与组件理解,要么聚焦于高得多的复合任务,如自主智能体的导航与任务完成。ScreenQA 试图弥合这一鸿沟。通过在 RICO 数据集上标注 86k 问答对,我们旨在基准化屏幕阅读理解能力,从而为基于截图的自动化奠定基础。我们的标注涵盖完整答案、简短答案短语,以及带边界框的对应 UI 内容,支持四项子任务以应对各类应用场景。我们在零样本、微调与迁移学习设置下,使用开放权重与专有模型评估了该数据集的有效性。我们进一步展示了对 Web 应用的积极迁移,凸显了其在移动应用之外的潜力。
引用
@article{arxiv.2209.08199,
title = {ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots},
author = {Yu-Chung Hsiao and Fedir Zubach and Gilles Baechler and Srinivas Sunkara and Victor Carbune and Jason Lin and Maria Wang and Yun Zhu and Jindong Chen},
journal= {arXiv preprint arXiv:2209.08199},
year = {2025}
}
备注
Accepted to NAACL 2025 Main Conference