中文

面向文档智能的视觉引导生成式文本-布局预训练

计算与语言 2024-03-28 v2 计算机视觉与模式识别

摘要

先前研究表明,预训练技术可以提升视觉文档理解(VDU)的性能,这通常要求模型具备感知和推理文档文本与布局(例如文本和表格单元格的位置)的能力。为此,我们提出视觉引导的生成式文本-布局预训练方法,命名为ViTLP。给定一张文档图像,模型优化层次化语言和布局建模目标,以生成交错的文本与布局序列。此外,为解决Transformer处理长文档的局限性,我们引入一种简单而有效的多段生成式预训练方案,使ViTLP能够处理任意长度的单词密集型文档。ViTLP可作为原生OCR模型,定位和识别文档图像中的文本。此外,ViTLP可有效应用于各种下游VDU任务。大量实验表明,ViTLP在信息抽取、文档分类和文档问答等基准VDU任务上,取得了与现有基线方法相比具有竞争力的性能。

关键词

引用

@article{arxiv.2403.16516,
  title  = {Visually Guided Generative Text-Layout Pre-training for Document Intelligence},
  author = {Zhiming Mao and Haoli Bai and Lu Hou and Jiansheng Wei and Xin Jiang and Qun Liu and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2403.16516},
  year   = {2024}
}

备注

Accepted to NAACL 2024 main conference. The first version of this paper was submitted to OpenReview (https://openreview.net/forum?id=ARtBIBAmNR) in June 2023