中文

DocScanner:基于渐进学习的鲁棒文档图像校正

计算机视觉与模式识别 2022-12-27 v3

摘要

与平面扫描仪相比,便携式智能手机为实体文档数字化提供了更大便利。然而,此类数字化文档常因不受控的物理形变、相机位置和光照变化而失真。为此,我们提出 DocScanner,一种用于文档图像校正的新型框架。与现有方案不同,DocScanner 通过引入渐进学习机制来解决该问题。具体而言,DocScanner 维护对校正图像的单一估计,并通过循环架构逐步修正。迭代细化使 DocScanner 收敛到鲁棒且优越的校正性能,而轻量级循环架构确保了运行效率。为了进一步提升校正质量,基于失真图像与校正图像之间的几何先验,在训练时引入几何正则化以进一步提高性能。我们在 Doc3D 数据集和 DocUNet Benchmark 数据集上进行了大量实验,定量与定性评估结果验证了 DocScanner 的有效性,其在 OCR 准确率、图像相似度以及我们提出的失真度量上以显著优势超越先前方法。此外,我们的 DocScanner 在运行延迟和模型大小上展现出优越的效率。

关键词

引用

@article{arxiv.2110.14968,
  title  = {DocScanner: Robust Document Image Rectification with Progressive Learning},
  author = {Hao Feng and Wengang Zhou and Jiajun Deng and Qi Tian and Houqiang Li},
  journal= {arXiv preprint arXiv:2110.14968},
  year   = {2022}
}