中文

SlideVQA:一个面向多图像文档视觉问答的数据集

计算与语言 2023-01-13 v1 计算机视觉与模式识别

摘要

针对包含文本、视觉和布局信息的文档图像进行视觉问答,即文档VQA,近来备受关注。尽管已提出许多数据集用于开发文档VQA系统,但现有数据集大多侧重于理解单张图像内部的内容关系,而非跨多张图像的关系。在本研究中,我们提出了一个新的多图像文档VQA数据集SlideVQA,包含2600多个幻灯片组,由52000多张幻灯片图像和14500个关于幻灯片组的问题组成。SlideVQA要求复杂的推理能力,包括单跳、多跳和数值推理,并提供了数值答案的标注算术表达式,以增强数值推理能力。此外,我们开发了一个新的端到端文档VQA模型,该模型以统一的序列到序列格式处理证据选择和问答。在SlideVQA上的实验表明,我们的模型优于现有的最先进问答模型,但与人类表现相比仍有很大差距。我们相信,我们的数据集将促进文档VQA的研究。

关键词

引用

@article{arxiv.2301.04883,
  title  = {SlideVQA: A Dataset for Document Visual Question Answering on Multiple Images},
  author = {Ryota Tanaka and Kyosuke Nishida and Kosuke Nishida and Taku Hasegawa and Itsumi Saito and Kuniko Saito},
  journal= {arXiv preprint arXiv:2301.04883},
  year   = {2023}
}

备注

Accepted by AAAI2023