中文

用于场景文本识别的2D-CTC方法

计算机视觉与模式识别 2019-07-24 v1 计算与语言 机器学习

摘要

场景文本识别多年来一直是计算机视觉中重要且活跃的研究课题。以往方法主要将文本视为一维信号,并借助最初为语音识别设计的CTC或基于注意力的编码器-解码器框架,将场景文本识别视为序列预测问题。然而,与作为一维信号的语音不同,文本实例本质上分布于二维图像空间中。为遵循并利用文本的二维特性以提升识别精度,我们将原始CTC模型扩展到第二维,从而创建了2D-CTC。2D-CTC能够自适应地聚焦于最相关特征,同时排除背景中杂波与噪声的影响;它还能自然地处理各种形态(水平、倾斜与弯曲)的文本实例,并给出更具可解释性的中间预测。在IIIT-5K、ICDAR 2015、SVP-Perspective与CUTE80等场景文本识别标准基准上的实验表明,所提出的2D-CTC模型在规则与不规则形状文本上均优于当前最优方法。此外,2D-CTC在训练与测试速度上展现出相对于已有方法的优势。我们的2D-CTC实现与模型将于不久后公开。

关键词

引用

@article{arxiv.1907.09705,
  title  = {2D-CTC for Scene Text Recognition},
  author = {Zhaoyi Wan and Fengming Xie and Yibo Liu and Xiang Bai and Cong Yao},
  journal= {arXiv preprint arXiv:1907.09705},
  year   = {2019}
}