NRTR:一种用于场景文本识别的无循环序列到序列模型
计算机视觉与模式识别
2019-10-11 v2
摘要
场景文本识别因其对各类应用的重要性而吸引了大量研究。现有方法主要采用基于循环或卷积的网络。尽管取得了良好性能,这些方法仍受限于两点:由于RNN内部循环导致的训练速度慢,以及为长程特征提取而堆叠卷积层带来的高复杂度。本文首次提出一种无循环序列到序列文本识别器,名为NRTR,其完全摒弃循环与卷积。NRTR遵循编码器-解码器范式,其中编码器使用堆叠自注意力提取图像特征,解码器应用堆叠自注意力基于编码器输出识别文本。NRTR仅依赖自注意力机制,因此可以以更高并行度与更低复杂度训练。考虑到场景图像中文本与背景差异大,我们进一步设计模态变换块以有效将2D输入图像变换为1D序列,结合编码器提取更具判别性的特征。NRTR在规整与不规则基准上均取得SOTA或极具竞争力的性能,而相较于文献中最佳模型仅需极小部分训练时间(至少快8倍)。
引用
@article{arxiv.1806.00926,
title = {NRTR: A No-Recurrence Sequence-to-Sequence Model For Scene Text Recognition},
author = {Fenfen Sheng and Zhineng Chen and Bo Xu},
journal= {arXiv preprint arXiv:1806.00926},
year = {2019}
}
备注
6 pages, 3 figures, 3 tables