StrucTexTv2:面向文档图像预训练的掩码视觉-文本预测
计算机视觉与模式识别
2023-03-02 v1
摘要
在本文中,我们提出 StrucTexTv2,一种通过执行掩码视觉-文本预测而实现的高效文档图像预训练框架。它包含两项自监督预训练任务:基于文本区域级图像掩码的掩码图像建模与掩码语言建模。所提方法依据文本词的边界框坐标随机掩码若干图像区域。我们预训练任务的目标为同时重建被掩码图像区域的像素与相应的被掩码词元。因此,相较于通常预测被掩码图像块的掩码图像建模,预训练编码器可捕获更多文本语义。相较于依赖图像与文本双模态的文档图像理解掩码多模态建模方法,StrucTexTv2 建模仅图像输入,并潜在地处理更多免 OCR 预处理的适用场景。在文档图像理解主流基准上的大量实验证明了 StrucTexTv2 的有效性。它在端到端场景下的图像分类、版式分析、表格结构识别、文档 OCR 与信息抽取等各类下游任务中取得有竞争力乃至全新的 SOTA 性能。
引用
@article{arxiv.2303.00289,
title = {StrucTexTv2: Masked Visual-Textual Prediction for Document Image Pre-training},
author = {Yuechen Yu and Yulin Li and Chengquan Zhang and Xiaoqiang Zhang and Zengyuan Guo and Xiameng Qin and Kun Yao and Junyu Han and Errui Ding and Jingdong Wang},
journal= {arXiv preprint arXiv:2303.00289},
year = {2023}
}
备注
ICLR 2023