中文

无约束场景文本识别的序列到序列学习

计算机视觉与模式识别 2016-07-22 v1 机器学习 神经与进化计算

摘要

本文提出了一种用于无约束自然场景文本识别的最先进方法。我们提出了一种级联方法,该方法结合卷积神经网络(CNN)架构与长短期记忆模型(LSTM)。CNN学习字符的视觉特征,并通过softmax层利用这些特征检测字符序列。虽然CNN能给出很好的识别结果,但它无法建模字符之间的关系,因此会产生误检和漏检情况(由于视觉相似性混淆字符,如"g"与"9",或将背景区域误认为字符:要么删去已有字符,要么添加不存在的字符)。为了缓解这些问题,我们利用LSTM架构的最新进展来编码上下文信息。我们表明LSTM可以显著减少此类错误,并在无约束自然场景文本识别任务中达到最先进精度。此外,我们手动将测试集中出现的所有词汇从训练集中移除,以检验该方法是否能泛化到未见数据。我们使用ICDAR 13测试集进行评估,并与最先进方法[11, 18]进行了比较。最后,我们在交通监控领域展示了该工作的应用。

关键词

引用

@article{arxiv.1607.06125,
  title  = {Sequence to sequence learning for unconstrained scene text recognition},
  author = {Ahmed Mamdouh A. Hassanien},
  journal= {arXiv preprint arXiv:1607.06125},
  year   = {2016}
}

备注

It is my master thesis. The thesis was done at Sony Technology Center Stuttgart and presented to Nile University. The thesis supervisors are Mark Blaxall, Fabien Cardinaux, and Motaz Abdelwahab