任意文档图像的级联鲁棒校正
计算机视觉与模式识别
2025-12-01 v1
摘要
现实场景下的文档校正面临相机视角和物理变形的极端变化带来的挑战。驱动该问题的洞见是:复杂的变换可以分解并逐步解决。我们引入一种新型多阶段框架,以粗到细的方式逐步逆转不同类型的变形。具体而言,该框架首先执行全局仿射变换以纠正因相机视角引起的透视变形,然后校正因纸张卷曲和折叠导致的几何变形,最后采用内容感知的迭代过程消除细粒度内容变形。为解决现有评估协议的局限性,我们还提出了两种增强指标:面向布局的 OCR 指标(AED/ACER)用于稳定评估几何校正质量,脱离 OCR 引擎布局分析错误;以及掩码 AD/AAD(AD-M/AAD-M)专为准确评估带有不完整边界文件几何变形而设计。大量实验表明,我们的方法在多个具有挑战性的基准测试上实现了最新的性能,显著降低 AAD 指标 14.1%--34.7%,并在实际应用中展现出卓越的有效性。代码将在 https://github.com/chaoyunwang/ArbDR 上公开。
引用
@article{arxiv.2511.23150,
title = {Cascaded Robust Rectification for Arbitrary Document Images},
author = {Chaoyun Wang and Quanxin Huang and I-Chao Shen and Takeo Igarashi and Nanning Zheng and Caigui Jiang},
journal= {arXiv preprint arXiv:2511.23150},
year = {2025}
}