中文

一种端到端可训练的基于图像的序列识别神经网络及其在场景文本识别中的应用

计算机视觉与模式识别 2015-07-22 v1

摘要

基于图像的序列识别一直是计算机视觉中一个长期的研究课题。本文研究了场景文本识别问题,这是基于图像的序列识别中最重要且最具挑战性的任务之一。我们提出了一种新颖的神经网络架构,将特征提取、序列建模和转录整合到一个统一的框架中。与以往的场景文本识别系统相比,所提出的架构具有四个显著特性:(1)它是端到端可训练的,而大多数现有算法的组件是分别训练和调优的。(2)它自然地处理任意长度的序列,无需字符分割或水平尺度归一化。(3)它不受任何预定义词典的限制,在无词典和基于词典的场景文本识别任务中均取得了卓越的性能。(4)它生成了一个有效但小得多的模型,这对于实际应用场景更为实用。在标准基准数据集(包括IIIT-5K、Street View Text和ICDAR数据集)上的实验证明了所提算法相对于先前技术的优越性。此外,该算法在基于图像的音乐乐谱识别任务中表现良好,这显然验证了其通用性。

关键词

引用

@article{arxiv.1507.05717,
  title  = {An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition},
  author = {Baoguang Shi and Xiang Bai and Cong Yao},
  journal= {arXiv preprint arXiv:1507.05717},
  year   = {2015}
}

备注

5 figures