PDFVQA:面向 PDF 文档真实场景 VQA 的新数据集
计算机视觉与模式识别
2023-06-07 v5 计算与语言
摘要
基于文档的视觉问答(Visual Question Answering)考察文档图像在自然语言问题条件下的文档理解能力。我们提出一个新的基于文档的 VQA 数据集 PDF-VQA,从文档元素识别、文档版式结构理解以及上下文理解与关键信息抽取等多方面综合考察文档理解。我们的 PDF-VQA 数据集将当前限于单页文档的文档理解规模扩展至对多页完整文档提问的新规模。我们还提出一种新的基于图的 VQA 模型,显式整合不同文档元素间的空间与层次结构关系以提升文档结构理解。性能在各类问题类型与任务上与若干基线进行比较\footnote{完整数据集将于论文录用后发布。}
引用
@article{arxiv.2304.06447,
title = {PDFVQA: A New Dataset for Real-World VQA on PDF Documents},
author = {Yihao Ding and Siwen Luo and Hyunsuk Chung and Soyeon Caren Han},
journal= {arXiv preprint arXiv:2304.06447},
year = {2023}
}
备注
Accepted by ECML-PKDD 2023