中文

面向复杂文档理解的离散推理

计算机视觉与模式识别 2023-05-05 v3 人工智能

摘要

文档视觉问答(VQA)旨在理解视觉丰富的文档以自然语言回答问题,这是自然语言处理与计算机视觉共同的新兴研究课题。本文中,我们引入一个名为TAT-DQA的新文档VQA数据集,它通过扩展TAT-QA数据集由3,067个文档页组成,包含半结构化表格与非结构化文本,以及16,558个问答对。这些文档采样自真实世界的财务报告并包含大量数字,意味着在该数据集上回答问题需要离散推理能力。基于TAT-DQA,我们进一步开发了一个名为MHST的新模型,它考虑多模态信息,包括文本、版式与视觉图像,以对应策略(即抽取或推理)智能地处理不同类型的问题。大量实验表明MHST模型显著优于基线方法,证明了其有效性。然而,其性能仍远落后于专家人类。我们期望新的TAT-DQA数据集能促进结合视觉与语言的视觉丰富文档深度理解研究,尤其是需要离散推理的场景。同时,我们希望所提模型能启发研究者未来设计更先进的文档VQA模型。我们的数据集将于https://nextplusplus.github.io/TAT-DQA/公开供非商业使用。

关键词

引用

@article{arxiv.2207.11871,
  title  = {Towards Complex Document Understanding By Discrete Reasoning},
  author = {Fengbin Zhu and Wenqiang Lei and Fuli Feng and Chao Wang and Haozhou Zhang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2207.11871},
  year   = {2023}
}

备注

ACM MM 2022