学习去噪:一种 GAN 视角
计算机视觉与模式识别
2019-02-01 v1
摘要
在大数据时代,将困在非结构化扫描文档(如发票、银行文件和快递收据)中的大量数据数字化的动力获得了新的势头。扫描过程常常引入诸如背景噪声、相机运动导致的模糊、水印、咖啡渍或褪色文本等伪影。这些伪影给当前的文本识别算法带来许多可读性挑战,并显著降低了其性能。现有的基于学习的去噪技术需要包含噪声文档与干净版本配对的数据集。在此类场景中,可以训练模型从噪声版本生成干净文档。然而,在现实世界中往往无法获得这样的配对数据集,我们用于训练去噪模型的仅有未配对的噪声和干净图像集合。本文探索使用 GAN 来生成噪声文档的去噪版本。特别地,在可获得配对信息时,我们将该问题表述为图像到图像翻译任务,即使用生成对抗网络(GAN)将文档从噪声域(即背景噪声、模糊、褪色、水印)翻译到目标干净文档。然而,在缺乏配对图像用于训练时,我们采用了 CycleGAN,其已知可利用未配对数据学习从噪声图像分布到去噪图像分布的映射,以实现用于清理噪声文档的图像到图像翻译。我们使用来自同一数据集的未配对图像,将 CycleGAN 用于文档清理任务的性能与在配对数据上训练的条件 GAN 进行了比较。实验在一个公开文档数据集上进行,该数据集上人工引入了不同类型的噪声,结果表明 CycleGAN 从噪声文档空间到干净文档空间学习了更鲁棒的映射。
引用
@article{arxiv.1901.11382,
title = {Learning to Clean: A GAN Perspective},
author = {Monika Sharma and Abhishek Verma and Lovekesh Vig},
journal= {arXiv preprint arXiv:1901.11382},
year = {2019}
}