中文

DocFormer:用于文档理解的端到端 Transformer

计算机视觉与模式识别 2021-09-21 v2

摘要

我们提出 DocFormer——一种基于多模态 Transformer 的架构,用于视觉文档理解(VDU)任务。VDU 是一项具有挑战性的问题,旨在理解各种格式(表单、收据等)和版式的文档。此外,DocFormer 使用精心设计的任务以无监督方式进行预训练,这些任务促进多模态交互。DocFormer 使用文本、视觉和空间特征,并通过新颖的多模态自注意力层将它们结合。DocFormer 还在各模态间共享学习的空间嵌入,使模型易于将文本与视觉 token 相关联,反之亦然。DocFormer 在 4 个不同数据集上进行了评估,每个数据集都有强基线。DocFormer 在所有数据集上均取得了最先进(state-of-the-art)结果,有时甚至击败了参数量为其 4 倍的模型。

关键词

引用

@article{arxiv.2106.11539,
  title  = {DocFormer: End-to-End Transformer for Document Understanding},
  author = {Srikar Appalaraju and Bhavan Jasani and Bhargava Urala Kota and Yusheng Xie and R. Manmatha},
  journal= {arXiv preprint arXiv:2106.11539},
  year   = {2021}
}

备注

Accepted to ICCV 2021 main conference