中文

通过学习字形规范形式提升场景字符识别

计算机视觉与模式识别 2019-07-26 v2

摘要

作为文档分析中的基础问题之一,场景字符识别近年来引起了相当多的关注。但由于字形变换、模糊、噪声背景、不均匀光照等许多不可控因素,该问题仍被认为极具挑战性。本文基于场景图像中出现的字符均派生自其相应规范形式这一事实,提出一种通过学习字形规范形式来提升场景字符识别的新方法。我们的关键观察是,与传统的基于分类的特征学习框架相比,通过求解专门设计的生成任务可以学到更具判别性的特征。具体而言,我们设计了一个基于 GAN 的模型,使给定场景字符学到的深度特征能够重建若干标准字体风格下的对应字形。以此方式,我们获得了对上述因素在识别中更具判别性且更不敏感的场景字符深度特征。在多个公开数据库上的实验证明了我们的方法相对于当前最优方法的优越性。

关键词

引用

@article{arxiv.1907.05577,
  title  = {Boosting Scene Character Recognition by Learning Canonical Forms of Glyphs},
  author = {Yizhi Wang and Zhouhui Lian and Yingmin Tang and Jianguo Xiao},
  journal= {arXiv preprint arXiv:1907.05577},
  year   = {2019}
}

备注

Accepted by International Journal on Document Analysis and Recognition (IJDAR), will appear in ICDAR 2019. Code: https://github.com/Actasidiot/CGRN