中文

DocFormerv2:面向文档理解的局部特征方法

计算机视觉与模式识别 2023-06-05 v1 计算与语言 机器学习

摘要

我们提出 DocFormerv2,一种用于视觉文档理解(VDU)的多模态变换器。VDU 领域需要对文档(超越单纯的 OCR 预测)进行理解,例如从表单中提取信息、文档 VQA 及其他任务。VDU 具有挑战性,因为它需要模型理解多种模态(视觉、语言和空间)以做出预测。我们的方法称为 DocFormerv2,是一种编码器-解码器变换器,以视觉、语言和空间特征作为输入。DocFormerv2 使用非对称采用的无监督任务进行预训练,即在编码器上设计两个新颖文档任务,在自回归解码器上设计一个。这些无监督任务经过精心设计,以确保预训练促进多种模态间的局部特征对齐。DocFormerv2 在九个数据集上评估时,展现出优于强基线的最先进性能,例如 TabFact(4.3%)、InfoVQA(1.4%)、FUNSD(1%)。此外,为展示泛化能力,在三个涉及场景文本的 VQA 任务上,DocFormerv2 优于先前同等规模的模型,甚至在某些任务上表现优于更大的模型(如 GIT2、PaLi 和 Flamingo)。大量消融实验表明,由于其预训练,DocFormerv2 比 VDU 领域的先前方法能更好地理解多种模态。

关键词

引用

@article{arxiv.2306.01733,
  title  = {DocFormerv2: Local Features for Document Understanding},
  author = {Srikar Appalaraju and Peng Tang and Qi Dong and Nishant Sankaran and Yichu Zhou and R. Manmatha},
  journal= {arXiv preprint arXiv:2306.01733},
  year   = {2023}
}