LayoutLMv3:以统一文本与图像掩码预训练用于文档 AI
计算与语言
2022-07-20 v3 计算机视觉与模式识别
摘要
自监督预训练技术在文档 AI 中取得了显著进展。多数多模态预训练模型使用掩码语言建模目标来学习文本模态上的双向表示,但它们在图像模态的预训练目标上各不相同。这种不一致增加了多模态表示学习的难度。本文提出 \textbf{LayoutLMv3},以统一的文本与图像掩码预训练用于文档 AI 的多模态 Transformer。此外,LayoutLMv3 以一个词-块对齐目标进行预训练,通过预测文本词对应的图像块是否被掩码来学习跨模态对齐。简洁的统一架构与训练目标使 LayoutLMv3 成为面向以文本为中心和以图像为中心的文档 AI 任务的通用预训练模型。实验结果表明,LayoutLMv3 不仅在以文本为中心的任务(包括表单理解、票据理解与文档视觉问答)中达到最先进性能,也在以图像为中心的任务(如文档图像分类与文档布局分析)中达到最先进性能。代码与模型公开于 \url{https://aka.ms/layoutlmv3}。
引用
@article{arxiv.2204.08387,
title = {LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking},
author = {Yupan Huang and Tengchao Lv and Lei Cui and Yutong Lu and Furu Wei},
journal= {arXiv preprint arXiv:2204.08387},
year = {2022}
}
备注
ACM Multimedia 2022