中文

基于滑动卷积字符模型的场景文本识别

计算机视觉与模式识别 2017-09-07 v1

摘要

近年来,场景文本识别引起了计算机视觉与模式识别领域的极大兴趣。最先进的方法使用卷积神经网络(CNNs)、带长短期记忆的循环神经网络(RNN-LSTM)或它们的组合。本文中,我们研究文本识别的内在特性,并受人类阅读文本的认知机制启发,提出了一种在卷积特征图上使用字符模型的场景文本识别方法。该方法通过使用在带有文本转写标注的文本行图像上端到端学习的字符模型滑动文本行图像,同时检测和识别字符。滑动窗口上的字符分类器输出被归一化并使用基于连接时序分类(CTC)的算法解码。与先前方法相比,我们的方法具有若干引人注目的特性:(1) 它避免了阻碍基于分割的识别方法性能的字符合割困难;(2) 模型可简单高效训练,因为它避免了训练基于RNN-LSTM模型中的梯度消失/爆炸;(3) 它基于无词典训练的字符模型,能够识别未知词;(4) 识别过程高度并行化并实现快速识别。我们在若干具有挑战性的英文和中文基准(包括IIIT-5K、SVT、ICDAR03/13和TRW15数据集)上的实验表明,所提方法在模型尺寸相对较小的同时,取得了优于或与最先进方法相当的性能。

关键词

引用

@article{arxiv.1709.01727,
  title  = {Scene Text Recognition with Sliding Convolutional Character Models},
  author = {Fei Yin and Yi-Chao Wu and Xu-Yao Zhang and Cheng-Lin Liu},
  journal= {arXiv preprint arXiv:1709.01727},
  year   = {2017}
}

备注

10 pages,4 figures