中文

用于场景文本识别的视觉注意力模型

计算机视觉与模式识别 2017-06-07 v1

摘要

本文提出了一种无词表的场景图像文本识别方法。该方法依赖于从卷积特征学习的基于LSTM的软视觉注意力模型。从对应图像不同区域的中间卷积层导出一组特征向量,这使得空间信息能够编码进图像表示中。这样,框架能够学习如何选择性地聚焦于图像的不同部分。在每个时间步,识别器根据学习到的注意力模型,利用卷积特征向量的加权组合输出一个字符。训练可仅使用词级标注端到端地进行。此外,我们展示了通过整合显式语言模型修改束搜索算法,能显著提升识别结果。我们在标准SVT和ICDAR'03场景文本数据集上验证了方法的性能,在无约束文本识别中达到了最先进水平。

关键词

引用

@article{arxiv.1706.01487,
  title  = {Visual attention models for scene text recognition},
  author = {Suman K. Ghosh and Ernest Valveny and Andrew D. Bagdanov},
  journal= {arXiv preprint arXiv:1706.01487},
  year   = {2017}
}