中文

自然场景下文档图像的本征分解

计算机视觉与模式识别 2020-12-01 v1

摘要

自动文档内容处理受纸张形状及非均匀多样光照颜色条件所致伪影影响。因所需数据量巨大,真实数据上的全监督方法不可行。因此,当前最优深度学习模型在完全或部分合成图像上训练。然而,文档阴影或明暗去除结果仍受困扰,因为:(a) 已有方法依赖局部颜色统计的均匀性,限制了其在具复杂文档形状与纹理的真实场景中的应用;且 (b) 使用具非真实模拟光照条件的合成或混合数据集训练模型。本文以两项主要贡献解决这些问题。第一,一种基于物理约束的学习方法,依据本征图像形成直接估计文档反射率,可泛化至挑战性光照条件。第二,一个新数据集,通过添加大范围真实阴影与多样多光源条件,明显改进先前合成数据集,且专为处理自然场景文档定制。所提架构以自监督方式工作,仅将合成纹理用作弱训练信号(免去对阴影与反射率解耦版本昂贵真值的需求)。所提方法显著提升了真实场景中挑战性光照下文档反射率估计的泛化性。我们在可用于本征图像分解与文档阴影去除任务的真实基准数据集上广泛评估。我们的反射率估计方案用作 OCR 流水线的预处理步骤时,字符错误率(CER)提升 26%,从而证明其实用性。

关键词

引用

@article{arxiv.2011.14447,
  title  = {Intrinsic Decomposition of Document Images In-the-Wild},
  author = {Sagnik Das and Hassan Ahmed Sial and Ke Ma and Ramon Baldrich and Maria Vanrell and Dimitris Samaras},
  journal= {arXiv preprint arXiv:2011.14447},
  year   = {2020}
}

备注

This a modified version of the BMVC 2020 accepted manuscript