中文

面向文档图像矫正的几何表示学习

计算机视觉与模式识别 2022-10-18 v1

摘要

在文档图像矫正中,失真图像与真实图像之间存在丰富的几何约束。然而,现有先进方案很大程度上忽略了此类几何约束,限制了矫正性能。为此,我们提出DocGeoNet,通过引入显式几何表示来进行文档图像矫正。从技术上讲,所提几何表示学习涉及文档图像的两个典型属性,即3D形状与文本行。我们的动机源于如下洞见:3D形状为矫正失真文档图像提供全局展平线索,但忽视了局部结构;另一方面,文本行互补地为局部模式提供显式几何约束。所学几何表示有效桥接了失真图像与真实图像。大量实验表明了我们的框架的有效性,并展示了我们的DocGeoNet在DocUNet Benchmark数据集和我们提出的DIR300测试集上优于最先进方法的优势。代码见 https://github.com/fh2019ustc/DocGeoNet。

关键词

引用

@article{arxiv.2210.08161,
  title  = {Geometric Representation Learning for Document Image Rectification},
  author = {Hao Feng and Wengang Zhou and Jiajun Deng and Yuechen Wang and Houqiang Li},
  journal= {arXiv preprint arXiv:2210.08161},
  year   = {2022}
}

备注

This paper has been accepted by ECCV 2022