中文

利用注意力卷积序列建模阅读场景文本

计算机视觉与模式识别 2017-09-14 v1

摘要

在野外阅读文本是计算机视觉领域的一项具有挑战性的任务。现有方法主要采用基于循环神经网络(RNN)的连接时序分类(CTC)或注意力模型,其计算代价高且难以训练。本文提出一种用于场景文本识别的端到端注意力卷积网络。首先,我们采用堆叠卷积层替代 RNN 来有效捕获输入序列的上下文依赖,其特点是较低的计算复杂度和更易并行计算。与循环网络的链状结构相比,卷积神经网络(CNN)提供了一种捕获元素间长期依赖的自然方式,其速度比双向长短期记忆(BLSTM)快 9 倍。此外,为增强前景文本的表示并抑制背景噪声,我们将残差注意力模块整合进一个小型密集连接网络以改进 CNN 特征的可分辨性。我们在标准基准(包括 Street View Text、IIIT5K 和 ICDAR 数据集)上验证了方法的性能。结果表明,最先进的或极具竞争力的性能与效率显示了所提方法的优越性。

关键词

引用

@article{arxiv.1709.04303,
  title  = {Reading Scene Text with Attention Convolutional Sequence Modeling},
  author = {Yunze Gao and Yingying Chen and Jinqiao Wang and Hanqing Lu},
  journal= {arXiv preprint arXiv:1709.04303},
  year   = {2017}
}