TextScanner:按序读取字符的鲁棒场景文本识别方法
计算机视觉与模式识别
2020-01-03 v2 计算与语言
机器学习
摘要
在深度学习和海量数据的驱动下,场景文本识别近年来发展迅速。此前,基于 RNN-注意力的方法主导了该领域,但在某些情况下存在注意力漂移的问题。近来,基于语义分割的算法已被证明能有效识别不同形态(水平、倾斜和弯曲)的文本。然而,这些方法可能产生伪字符或遗漏真实字符,因为它们严重依赖于在分割图上进行的阈值处理过程。为应对这些挑战,我们在本文中提出一种名为 TextScanner 的替代方法用于场景文本识别。TextScanner 具有三个特点:(1)本质上,它属于语义分割家族,因为它生成针对字符类别、位置和顺序的逐像素多通道分割图;(2)同时,类似于基于 RNN-注意力的方法,它也采用 RNN 进行上下文建模;(3)此外,它对字符位置和类别进行并行预测,并确保字符按正确顺序转录。在标准基准数据集上的实验表明,TextScanner 优于当前最优方法。而且,TextScanner 在识别更难的文字(如中文文本)以及与目标字符对齐方面展现出优越性。
引用
@article{arxiv.1912.12422,
title = {TextScanner: Reading Characters in Order for Robust Scene Text Recognition},
author = {Zhaoyi Wan and Minghang He and Haoran Chen and Xiang Bai and Cong Yao},
journal= {arXiv preprint arXiv:1912.12422},
year = {2020}
}
备注
Accepted by AAAI-2020