一种用于场景文本识别的多目标校正注意力网络
计算机视觉与模式识别
2019-01-11 v1
摘要
不规则文本被广泛使用。然而,由于其形状和扭曲模式多样,识别起来相当困难。因此,本文提出一种用于通用场景文本识别的多目标校正注意力网络 (MORAN)。MORAN 由一个多目标校正网络和一个基于注意力的序列识别网络组成。多目标校正网络旨在校正含有不规则文本的图像。它降低了识别难度,并使基于注意力的序列识别网络更容易读取不规则文本。该网络以弱监督方式训练,因此仅需图像及相应文本标签。基于注意力的序列识别网络聚焦于目标字符并顺序输出预测结果。此外,为提高基于注意力的序列识别网络的敏感性,在训练阶段为基于注意力的解码器提出了一种分数拾取方法。借助校正机制,MORAN 可同时读取规则与不规则场景文本。在各种基准上进行了大量实验,表明 MORAN 达到了最先进 (state-of-the-art) 性能。源代码已公开。
引用
@article{arxiv.1901.03003,
title = {A Multi-Object Rectified Attention Network for Scene Text Recognition},
author = {Canjie Luo and Lianwen Jin and Zenghui Sun},
journal= {arXiv preprint arXiv:1901.03003},
year = {2019}
}
备注
9 Tables, 9 Figures. Accepted to appear in Pattern Recognition, 2019