中文

受损扫描文档的自主清洁——一种生成式建模方法

计算机视觉与模式识别 2014-10-21 v2 机器学习

摘要

我们研究清洁被手动划线、泼洒墨水等污迹严重损坏的扫描文本文档的任务。我们的目标是仅基于页面包含的信息,自主地从单张信纸大小的页面中去除污迹。因此,我们的方法必须在无监督的情况下学习字符表示,并需要一种机制来区分学习到的表示与不规则模式。为了学习字符表示,我们使用一个概率生成模型对模式特征、特征方差、特征的平面排列以及模式频率进行参数化。模型的潜变量描述了模式类别、模式位置以及各个模式特征的存在与否。模型参数使用一种新颖的变分 EM 近似进行优化。学习完成后,参数独立于其绝对位置表示平面特征排列及其方差。随后,基于学习到的表示定义的质量度量允许自主区分规则字符模式与构成污迹的不规则模式。从而可以去除不规则模式以清洁文档。对于完整的拉丁字母表,我们发现单页不包含足够多的字符示例。然而,即使被污迹严重损坏,我们表明包含较少字符类型的页面可以仅基于其包含的字符的结构规律性被高效且自主地清洁。在使用来自不同字母表字符的不同示例中,我们展示了该方法的通用性,并讨论了其对未来发展的启示。

关键词

引用

@article{arxiv.1201.2605,
  title  = {Autonomous Cleaning of Corrupted Scanned Documents - A Generative Modeling Approach},
  author = {Zhenwen Dai and Jörg Lücke},
  journal= {arXiv preprint arXiv:1201.2605},
  year   = {2014}
}

备注

oral presentation and Google Student Travel Award; IEEE conference on Computer Vision and Pattern Recognition 2012