DUBLIN——基于语言-图像网络的文档理解
计算机视觉与模式识别
2023-10-30 v4 人工智能
摘要
视觉文档理解是一项复杂任务,涉及对文档图像中文本与视觉元素的分析。现有模型通常依赖人工特征工程或特定领域流水线,这限制了它们在不同文档类型与语言上的泛化能力。本文提出 DUBLIN,其在网页上通过三个新颖目标进行预训练:掩码文档文本生成任务、边界框任务与渲染问答任务,这些目标利用了文档图像中的空间与语义信息。我们的模型在多个基准上取得了有竞争力或最先进的结果,如基于网页的结构化阅读理解、文档视觉问答、关键信息抽取、图表理解与表格问答。特别地,我们展示了 DUBLIN 是首个在 WebSRC 数据集上取得 EM 77.75 与 F1 84.25 的基于像素的模型。我们还展示了我们的模型在 DocVQA、InfographicsVQA、OCR-VQA 与 AI2D 数据集上分别超越当前基于像素的 SOTA 模型 4.6%、6.5%、2.6% 与 21%。我们也在 RVL-CDIP 文档分类上取得了有竞争力的性能。此外,我们将基于文本的数据库渲染为文档图像,从而为这一方向的研究创建了新的基线。
引用
@article{arxiv.2305.14218,
title = {DUBLIN -- Document Understanding By Language-Image Network},
author = {Kriti Aggarwal and Aditi Khandelwal and Kumar Tanmay and Owais Mohammed Khan and Qiang Liu and Monojit Choudhury and Hardik Hansrajbhai Chauhan and Subhojit Som and Vishrav Chaudhary and Saurabh Tiwary},
journal= {arXiv preprint arXiv:2305.14218},
year = {2023}
}