中文

面向多页文档视觉问答的分层多模态 Transformer

计算机视觉与模式识别 2023-04-05 v2 人工智能 计算与语言

摘要

文档视觉问答(DocVQA)指从文档图像中回答问题的任务。现有 DocVQA 工作仅考虑单页文档。然而,在实际场景中,文档大多由多页组成,应被整体处理。本文中将 DocVQA 扩展至多页场景。为此,我们首先创建了一个新数据集 MP-DocVQA,其中问题针对多页文档而非单页提出。其次,我们提出了一种基于 T5 架构的新分层方法 Hi-VT5,克服了当前方法处理长多页文档的局限。所提方法基于分层 Transformer 架构,其中编码器汇总每页最相关信息,随后解码器利用这些汇总信息生成最终答案。通过大量实验,我们证明我们的方法能够在单阶段内回答问题并给出包含查找答案所需相关信息的页码,这可用作一种可解释性度量。

关键词

引用

@article{arxiv.2212.05935,
  title  = {Hierarchical multimodal transformers for Multi-Page DocVQA},
  author = {Rubèn Tito and Dimosthenis Karatzas and Ernest Valveny},
  journal= {arXiv preprint arXiv:2212.05935},
  year   = {2023}
}