中文

深度无限制文档图像矫正

计算机视觉与模式识别 2023-12-19 v2

摘要

近年来,文档图像矫正已得到大量研究投入,但现有先进算法局限于处理受限制的文档图像,即输入图像必须包含完整文档。一旦所拍摄图像仅涉及局部文本区域,其矫正质量便会下降且不尽如人意。我们此前提出的DocTr——一种用于文档图像矫正的Transformer辅助网络——同样受此限制。在本工作中,我们提出DocTr++,一种用于文档图像矫正的新型统一框架,对输入失真图像无任何限制。我们的主要技术改进可归纳为三方面。首先,我们采用分层编码器-解码器结构进行多尺度表征提取与解析,从而升级了原有架构。其次,我们重构了无限制失真文档图像与无失真对应图像之间的逐像素映射关系。所得数据用于训练我们的DocTr++以实现无限制文档图像矫正。第三,我们贡献了一个适用于评估矫正质量的真实世界测试集与指标。据我们所知,这是首个基于学习的无限制文档图像矫正方法。我们进行了大量实验,结果证明了本方法的有效性与优越性。我们希望我们的DocTr++能作为通用文档图像矫正的强基线,推动基于学习的算法的进一步发展与运用。源代码与所提出的数据集公开于 https://github.com/fh2019ustc/DocTr-Plus。

关键词

引用

@article{arxiv.2304.08796,
  title  = {Deep Unrestricted Document Image Rectification},
  author = {Hao Feng and Shaokai Liu and Jiajun Deng and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2304.08796},
  year   = {2023}
}

备注

Accepted by TMM 2023