中文

DiT:面向文档图像Transformer的自监督预训练

计算机视觉与模式识别 2022-07-20 v3

摘要

Image Transformer近期在自然图像理解方面取得了显著进展,无论是采用有监督(ViT、DeiT等)还是自监督(BEiT、MAE等)预训练技术。本文中,我们提出\textbf{DiT},一种利用大规模无标签文本图像为文档AI任务进行自监督预训练的\textbf{D}ocument \textbf{I}mage \textbf{T}ransformer模型,这一点至关重要,因为由于缺乏人工标注的文档图像,从未存在有监督的对应模型。我们将DiT作为多种基于视觉的文档AI任务的骨干网络,包括文档图像分类、文档布局分析、表格检测以及面向OCR的文本检测。实验结果表明,自监督预训练的DiT模型在这些下游任务上取得了新的SOTA结果,例如文档图像分类(91.11 \rightarrow 92.69)、文档布局分析(91.0 \rightarrow 94.9)、表格检测(94.23 \rightarrow 96.55)以及面向OCR的文本检测(93.07 \rightarrow 94.29)。代码与预训练模型公开于\url{https://aka.ms/msdit}。

关键词

引用

@article{arxiv.2203.02378,
  title  = {DiT: Self-supervised Pre-training for Document Image Transformer},
  author = {Junlong Li and Yiheng Xu and Tengchao Lv and Lei Cui and Cha Zhang and Furu Wei},
  journal= {arXiv preprint arXiv:2203.02378},
  year   = {2022}
}

备注

ACM Multimedia 2022