DocMAE:基于自监督表示学习的文档图像校正
计算机视觉与模式识别
2023-04-21 v1
摘要
在文档图像校正方面已做出巨大努力,但如何学习此类畸变图像的有效表示仍鲜有探索。在本文中,我们提出 DocMAE,一种用于文档图像校正的新型自监督框架。我们的动机是利用掩码自编码器编码文档图像中的结构线索以惠及校正,即文档边界与文本行。具体而言,我们首先对去背景文档图像的随机块进行掩码,然后重建缺失像素。通过此种自监督学习方法,网络被鼓励通过恢复文档边界与缺失文本行来学习形变文档的内在结构。下游校正任务中的迁移性能验证了我们方法的有效性。进行了大量实验以证明我们方法的有效性。
引用
@article{arxiv.2304.10341,
title = {DocMAE: Document Image Rectification via Self-supervised Representation Learning},
author = {Shaokai Liu and Hao Feng and Wengang Zhou and Houqiang Li and Cong Liu and Feng Wu},
journal= {arXiv preprint arXiv:2304.10341},
year = {2023}
}
备注
Accepted to ICME 2023