中文

MASTER:用于场景文本识别的多方面非局部网络

计算机视觉与模式识别 2021-04-13 v3

摘要

基于注意力的场景文本识别器取得了巨大成功,其利用更紧凑的中间表示,通过基于 RNN 的编码器-解码器架构学习一维或二维注意力。然而,由于编码特征间高度相似导致在基于 RNN 的局部注意力机制下出现注意力混淆,此类方法存在注意力漂移问题。此外,基于 RNN 的方法因并行性差而效率低下。为克服这些问题,我们提出 MASTER,一种基于自注意力的场景文本识别器,其(1)不仅对输入-输出注意力进行编码,还学习自注意力,在编码器和解码器内部编码特征-特征与目标-目标关系;(2)学习对空间畸变更强大且鲁棒的中间表示;(3)因高训练并行化而拥有极佳训练效率,并因高效的内存缓存机制而具备高速推理。在多个基准上的大量实验表明,我们的 MASTER 在规则与不规则场景文本上均具有优越性能。Pytorch 代码见 https://github.com/wenwenyu/MASTER-pytorch,Tensorflow 代码见 https://github.com/jiangxiluning/MASTER-TF。

关键词

引用

@article{arxiv.1910.02562,
  title  = {MASTER: Multi-Aspect Non-local Network for Scene Text Recognition},
  author = {Ning Lu and Wenwen Yu and Xianbiao Qi and Yihao Chen and Ping Gong and Rong Xiao and Xiang Bai},
  journal= {arXiv preprint arXiv:1910.02562},
  year   = {2021}
}

备注

Accepted by Pattern Recognition. Ning Lu and Wenwen Yu are co-first authors