中文

SAFE:用于场景文本识别的尺度感知特征编码器

计算机视觉与模式识别 2019-01-18 v1

摘要

本文中,我们解决场景文本识别中字符尺度不一的问题。我们提出一种新颖的尺度感知特征编码器(SAFE),专为编码不同尺度的字符而设计。SAFE由多尺度卷积编码器与尺度注意力网络组成。多尺度卷积编码器旨在提取多尺度下的字符特征,尺度注意力网络负责从最相关的尺度中选择特征。相较于当前最先进文本识别器中使用的传统单CNN编码器,SAFE有两大优势。首先,它通过从字符中提取尺度不变特征显式地处理尺度问题。这使识别器能更专注于应对场景文本识别中的其他挑战,如视角畸变与图像质量差所致者。其次,它能在不同字符尺度间迁移特征编码的学习。当训练集中字符尺度分布极不均衡时这一点尤为重要,因为以此类数据集训练会使编码器偏向于从主导尺度提取特征。为评估SAFE有效性,我们设计了一个以SAFE为特征编码器的简单文本识别器——尺度-空间注意力网络(S-SAN),并在六个公开基准上实验。实验结果表明,S-SAN无需任何后处理即可达到最先进水平(或某些情况下极具竞争力的)性能。

关键词

引用

@article{arxiv.1901.05770,
  title  = {SAFE: Scale Aware Feature Encoder for Scene Text Recognition},
  author = {Wei Liu and Chaofeng Chen and Kwan-Yee K. Wong},
  journal= {arXiv preprint arXiv:1901.05770},
  year   = {2019}
}

备注

ACCV2018