中文

面向视觉文档理解的基于统一模态掩码的顺序到顺序预训练

计算与语言 2023-05-19 v1 人工智能

摘要

本文提出GenDoc,一种通用的顺序到顺序文档理解模型,通过跨文本、图像和布局三种模态的统一掩码进行预训练。所提模型采用编码器-解码器架构,与文档理解中常用的仅编码器模型相比,可增强对具有多样输出格式的广泛下游任务的适应性。除先前编码器-解码器模型使用的传统文本填充任务外,我们的预训练还扩展到包含掩码图像词元预测和掩码布局预测任务。我们还设计了模态特定指令,并采用解耦注意力和混合模态专家策略,以有效捕获各模态所利用的信息。通过在文档理解中多个下游任务上的大量实验评估,所提模型展现出优于或媲美最先进方法的性能。我们的分析进一步表明,在OCR质量不完美的场景下,GenDoc比仅编码器模型更具鲁棒性。

关键词

引用

@article{arxiv.2305.10448,
  title  = {Sequence-to-Sequence Pre-training with Unified Modality Masking for Visual Document Understanding},
  author = {Shuwei Feng and Tianyang Zhan and Zhanming Jie and Trung Quoc Luong and Xiaoran Jin},
  journal= {arXiv preprint arXiv:2305.10448},
  year   = {2023}
}