LayoutLMv2:面向富视觉文档理解的多模态预训练
计算与语言
2022-01-11 v4
摘要
文本与版式的预训练因其在各种富视觉文档理解任务中的有效模型架构以及大规模无标注扫描/数字原生文档的优势而被证明是有效的。我们提出了具有新预训练任务的 LayoutLMv2 架构,以在单一多模态框架中对文本、版式和图像之间的交互进行建模。具体而言,借助双流多模态 Transformer 编码器,LayoutLMv2 不仅使用了已有的掩码视觉-语言建模任务,还使用了新的文本-图像对齐和文本-图像匹配任务,使其能在预训练阶段更好地捕捉跨模态交互。同时,它还将空间感知自注意力机制集成到 Transformer 架构中,使模型能充分理解不同文本块之间的相对位置关系。实验结果表明,LayoutLMv2 大幅优于 LayoutLM,并在广泛的下游富视觉文档理解任务上取得了新的最先进结果,包括 FUNSD (0.7895 0.8420)、CORD (0.9493 0.9601)、SROIE (0.9524 0.9781)、Kleister-NDA (0.8340 0.8520)、RVL-CDIP (0.9443 0.9564) 和 DocVQA (0.7295 0.8672)。我们在 \url{https://aka.ms/layoutlmv2} 公开了我们的模型和代码。
引用
@article{arxiv.2012.14740,
title = {LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding},
author = {Yang Xu and Yiheng Xu and Tengchao Lv and Lei Cui and Furu Wei and Guoxin Wang and Yijuan Lu and Dinei Florencio and Cha Zhang and Wanxiang Che and Min Zhang and Lidong Zhou},
journal= {arXiv preprint arXiv:2012.14740},
year = {2022}
}
备注
ACL 2021 main conference