中文

基于时序卷积编码器的场景文本识别

计算机视觉与模式识别 2020-02-18 v2

摘要

场景图像中的文本通常由若干字符组成并呈现特有的序列结构。现有方法通过序列到序列模型利用编码器获取视觉表示、再由解码器将特征翻译为标签序列来捕获该结构。本文在编码器阶段考虑长时时序依赖,研究文本识别框架。我们证明所提出的具有增大序列范围的时序卷积编码器提高了文本识别的准确率。我们还研究了卷积块中不同注意力模块对于学习准确文本表示的影响。我们在七个数据集上进行了对比,实验证明了我们所提方法的有效性。

关键词

引用

@article{arxiv.1911.01051,
  title  = {Scene Text Recognition with Temporal Convolutional Encoder},
  author = {Xiangcheng Du and Tianlong Ma and Yingbin Zheng and Hao Ye and Xingjiao Wu and Liang He},
  journal= {arXiv preprint arXiv:1911.01051},
  year   = {2020}
}