中文

NRTR:一种用于场景文本识别的无循环序列到序列模型

计算机视觉与模式识别 2019-10-11 v2

摘要

场景文本识别因其对各类应用的重要性而吸引了大量研究。现有方法主要采用基于循环或卷积的网络。尽管取得了良好性能,这些方法仍受限于两点:由于RNN内部循环导致的训练速度慢,以及为长程特征提取而堆叠卷积层带来的高复杂度。本文首次提出一种无循环序列到序列文本识别器,名为NRTR,其完全摒弃循环与卷积。NRTR遵循编码器-解码器范式,其中编码器使用堆叠自注意力提取图像特征,解码器应用堆叠自注意力基于编码器输出识别文本。NRTR仅依赖自注意力机制,因此可以以更高并行度与更低复杂度训练。考虑到场景图像中文本与背景差异大,我们进一步设计模态变换块以有效将2D输入图像变换为1D序列,结合编码器提取更具判别性的特征。NRTR在规整与不规则基准上均取得SOTA或极具竞争力的性能,而相较于文献中最佳模型仅需极小部分训练时间(至少快8倍)。

关键词

引用

@article{arxiv.1806.00926,
  title  = {NRTR: A No-Recurrence Sequence-to-Sequence Model For Scene Text Recognition},
  author = {Fenfen Sheng and Zhineng Chen and Bo Xu},
  journal= {arXiv preprint arXiv:1806.00926},
  year   = {2019}
}

备注

6 pages, 3 figures, 3 tables