从二维视角进行场景文本识别
计算机视觉与模式识别
2018-11-20 v2
摘要
受语音识别启发,近期最先进的算法大多将场景文本识别视为序列预测问题。尽管取得了优异性能,这些方法通常忽略了一个重要事实:图像中的文本实际上分布在二维空间中。这是与语音本质为一维信号截然不同的性质。原则上,直接将文本特征压缩为一维形式可能会丢失有用信息并引入额外噪声。本文从二维视角出发研究场景文本识别。我们设计了一个简单而有效的模型,称为字符注意力全卷积网络(Character Attention Fully Convolutional Network, CA-FCN),用于识别任意形状的文本。场景文本识别通过一个语义分割网络实现,其中采用了一种面向字符的注意力机制。结合词形生成模块,CA-FCN能够同时识别文字并预测每个字符的位置。实验表明,所提算法在规则与不规则文本数据集上均优于以往方法。此外,事实证明该方法对文本检测阶段中常见的不精确定位具有更强的鲁棒性。
引用
@article{arxiv.1809.06508,
title = {Scene Text Recognition from Two-Dimensional Perspective},
author = {Minghui Liao and Jian Zhang and Zhaoyi Wan and Fengming Xie and Jiajun Liang and Pengyuan Lyu and Cong Yao and Xiang Bai},
journal= {arXiv preprint arXiv:1809.06508},
year = {2018}
}
备注
To appear in AAAI 2019