中文

ESIR:通过迭代图像校正实现端到端场景文本识别

计算机视觉与模式识别 2019-04-03 v3

摘要

场景文本自动识别多年来一直是一项研究挑战,主要由于文本外观在透视畸变、文本行弯曲、文本风格及不同类型成像伪影方面的任意变化。近期的深度网络能够学习针对成像伪影和文本风格变化的鲁棒表示,但在处理具有透视和弯曲畸变的场景文本时仍面临各种问题。本文提出一种端到端可训练的场景文本识别系统(ESIR),其以更好的场景文本识别性能为驱动,迭代地去除透视畸变和文本行弯曲。我们开发了一种创新的校正网络,采用新颖的线拟合变换来估计场景中文本行的位姿。此外,开发了迭代校正流程,将场景文本畸变迭代校正至正面平行视图。ESIR 对参数初始化也具有鲁棒性,且训练仅需场景文本图像和词级标注,正如大多数场景文本识别系统所要求的那样。在多个公开数据集上的大量实验表明,所提出的 ESIR 能够准确校正场景文本畸变,在常规场景文本图像及受透视和弯曲畸变影响的图像上均取得了优越的识别性能。

关键词

引用

@article{arxiv.1812.05824,
  title  = {ESIR: End-to-end Scene Text Recognition via Iterative Image Rectification},
  author = {Fangneng Zhan and Shijian Lu},
  journal= {arXiv preprint arXiv:1812.05824},
  year   = {2019}
}

备注

Accepted to CVPR 2019