中文

基于 Transformer 的场景文本识别

计算机视觉与模式识别 2020-04-30 v4

摘要

任意形状的场景文本识别因文本形状、字体、颜色、背景等的巨大变化而极具挑战。多数最先进算法将输入图像矫正为归一化图像,然后将识别视为序列预测任务。此类方法的瓶颈在于矫正,其会因透视畸变引起误差。在本文中,我们发现矫正完全不必要。我们所需仅是空间注意力。因此我们提出了一种基于 transformer [50] 的简单但极有效的场景文本识别方法。与之前基于 transformer 的模型 [56,34] 仅使用 transformer 解码器解码卷积注意力不同,所提方法将卷积特征图作为词嵌入输入到 transformer 中。如此,我们的方法能够充分利用 transformer 强大的注意力机制。大量实验结果表明,所提方法在规则与不规则文本数据集上均以极大优势显著优于最先进方法。在最具挑战性的 Cute 数据集(其最先进预测准确率为 89.6%)上,我们的方法达到了 99.3%,这是一个相当令人惊讶的结果。我们将发布源代码,并相信我们的方法将成为任意形状场景文本识别的新基准。

关键词

引用

@article{arxiv.2003.08077,
  title  = {Scene Text Recognition via Transformer},
  author = {Xinjie Feng and Hongxun Yao and Yuankai Qi and Jun Zhang and Shengping Zhang},
  journal= {arXiv preprint arXiv:2003.08077},
  year   = {2020}
}

备注

We found that there are some errors in the experiment code, and we are correcting the result temporarily, so we temporarily withdraw this paper