基于深度卷积序列的场景文本读取
计算机视觉与模式识别
2015-12-22 v2
摘要
我们提出了一种深度文本循环网络(Deep-Text Recurrent Network, DTRN),将场景文本读取视为序列标注问题。我们利用深度卷积神经网络的最新进展,从整个词图像生成有序的高级序列,从而避免了困难的字符分割问题。然后,我们开发了一种基于长短期记忆(LSTM)的深度循环模型,以鲁棒地识别生成的 CNN 序列,这有别于大多数独立识别每个字符的现有方法。与现有场景文本识别方法相比,我们的模型具有若干引人注目的特性:(i) 它能够通过利用有意义的上下文信息来识别高度模糊的单词,从而无需任何预处理或后处理即可可靠工作;(ii) 深度 CNN 特征对各种图像失真具有鲁棒性;(iii) 它保留了词图像中的显式顺序信息,而这是区分词串的关键;(iv) 该模型不依赖于预定义词典,并且可以处理未知单词和任意字符串。DTRN 的代码将公开。
引用
@article{arxiv.1506.04395,
title = {Reading Scene Text in Deep Convolutional Sequences},
author = {Pan He and Weilin Huang and Yu Qiao and Chen Change Loy and Xiaoou Tang},
journal= {arXiv preprint arXiv:1506.04395},
year = {2015}
}
备注
To appear in the 13th AAAI Conference on Artificial Intelligence (AAAI-16), 2016