SlideVQA:一个面向多图像文档视觉问答的数据集
计算与语言
2023-01-13 v1 计算机视觉与模式识别
摘要
针对包含文本、视觉和布局信息的文档图像进行视觉问答,即文档VQA,近来备受关注。尽管已提出许多数据集用于开发文档VQA系统,但现有数据集大多侧重于理解单张图像内部的内容关系,而非跨多张图像的关系。在本研究中,我们提出了一个新的多图像文档VQA数据集SlideVQA,包含2600多个幻灯片组,由52000多张幻灯片图像和14500个关于幻灯片组的问题组成。SlideVQA要求复杂的推理能力,包括单跳、多跳和数值推理,并提供了数值答案的标注算术表达式,以增强数值推理能力。此外,我们开发了一个新的端到端文档VQA模型,该模型以统一的序列到序列格式处理证据选择和问答。在SlideVQA上的实验表明,我们的模型优于现有的最先进问答模型,但与人类表现相比仍有很大差距。我们相信,我们的数据集将促进文档VQA的研究。
引用
@article{arxiv.2301.04883,
title = {SlideVQA: A Dataset for Document Visual Question Answering on Multiple Images},
author = {Ryota Tanaka and Kyosuke Nishida and Kosuke Nishida and Taku Hasegawa and Itsumi Saito and Kuniko Saito},
journal= {arXiv preprint arXiv:2301.04883},
year = {2023}
}
备注
Accepted by AAAI2023