中文

DeepErase:文档文本图像中墨迹伪影的弱监督去除

计算机视觉与模式识别 2020-01-17 v3 机器学习 神经与进化计算

摘要

保险、法律和政府等纸张密集型行业长期利用光学字符识别(OCR)将大量扫描文档自动转录为文本字符串,以供下游处理。即使在2019年,仍有大量扫描文档和邮件以非数字格式进入企业。从真实世界文档中提取的文本通常嵌套在丰富的格式中,例如表格结构或带有填空框或下划线的表单,其墨迹常常触及甚至划穿文本本身的墨迹。此外,文本区域可能存在随机的墨迹污迹或杂散笔画。此类墨迹伪影会严重干扰识别算法或其他下游处理任务的性能。在这项工作中,我们提出DeepErase,一种基于神经网络的预处理器,用于擦除文本图像中的墨迹伪影。我们设计了一种方法,以编程方式将真实文本图像和真实伪影组合成逼真的“脏”文本图像,并以弱监督方式训练伪影分割网络,因为像素级标注在组合过程中自动获得。除了高分割精度外,我们还展示了经清洗的图像在流行的OCR软件(如Tesseract 4.0)中显著提升了识别准确率。最后,我们在扫描的IRS纳税申报表分布外数据集(NIST SDB)上测试了DeepErase,并实现了两位数的准确率提升。所有实验均在印刷体和手写体文本上进行。所有实验代码可在https://github.com/yikeqicn/DeepErase获取。

关键词

引用

@article{arxiv.1910.07070,
  title  = {DeepErase: Weakly Supervised Ink Artifact Removal in Document Text Images},
  author = {W. Ronny Huang and Yike Qi and Qianqian Li and Jonathan Degange},
  journal= {arXiv preprint arXiv:1910.07070},
  year   = {2020}
}

备注

Conference paper at WACV 2020. First two authors contributed equally