中文

TextScanner:按序读取字符的鲁棒场景文本识别方法

计算机视觉与模式识别 2020-01-03 v2 计算与语言 机器学习

摘要

在深度学习和海量数据的驱动下,场景文本识别近年来发展迅速。此前,基于 RNN-注意力的方法主导了该领域,但在某些情况下存在注意力漂移的问题。近来,基于语义分割的算法已被证明能有效识别不同形态(水平、倾斜和弯曲)的文本。然而,这些方法可能产生伪字符或遗漏真实字符,因为它们严重依赖于在分割图上进行的阈值处理过程。为应对这些挑战,我们在本文中提出一种名为 TextScanner 的替代方法用于场景文本识别。TextScanner 具有三个特点:(1)本质上,它属于语义分割家族,因为它生成针对字符类别、位置和顺序的逐像素多通道分割图;(2)同时,类似于基于 RNN-注意力的方法,它也采用 RNN 进行上下文建模;(3)此外,它对字符位置和类别进行并行预测,并确保字符按正确顺序转录。在标准基准数据集上的实验表明,TextScanner 优于当前最优方法。而且,TextScanner 在识别更难的文字(如中文文本)以及与目标字符对齐方面展现出优越性。

关键词

引用

@article{arxiv.1912.12422,
  title  = {TextScanner: Reading Characters in Order for Robust Scene Text Recognition},
  author = {Zhaoyi Wan and Minghang He and Haoran Chen and Xiang Bai and Cong Yao},
  journal= {arXiv preprint arXiv:1912.12422},
  year   = {2020}
}

备注

Accepted by AAAI-2020