中文

一种用于场景文本识别的多目标校正注意力网络

计算机视觉与模式识别 2019-01-11 v1

摘要

不规则文本被广泛使用。然而,由于其形状和扭曲模式多样,识别起来相当困难。因此,本文提出一种用于通用场景文本识别的多目标校正注意力网络 (MORAN)。MORAN 由一个多目标校正网络和一个基于注意力的序列识别网络组成。多目标校正网络旨在校正含有不规则文本的图像。它降低了识别难度,并使基于注意力的序列识别网络更容易读取不规则文本。该网络以弱监督方式训练,因此仅需图像及相应文本标签。基于注意力的序列识别网络聚焦于目标字符并顺序输出预测结果。此外,为提高基于注意力的序列识别网络的敏感性,在训练阶段为基于注意力的解码器提出了一种分数拾取方法。借助校正机制,MORAN 可同时读取规则与不规则场景文本。在各种基准上进行了大量实验,表明 MORAN 达到了最先进 (state-of-the-art) 性能。源代码已公开。

关键词

引用

@article{arxiv.1901.03003,
  title  = {A Multi-Object Rectified Attention Network for Scene Text Recognition},
  author = {Canjie Luo and Lianwen Jin and Zenghui Sun},
  journal= {arXiv preprint arXiv:1901.03003},
  year   = {2019}
}

备注

9 Tables, 9 Figures. Accepted to appear in Pattern Recognition, 2019