基于注意力卷积-LSTM 网络的自然场景图像与视频帧文字系统识别
计算机视觉与模式识别
2018-08-08 v4
摘要
文字系统识别在分析文档和视频中起着重要作用。本文关注自然场景文本图像和视频文字中的文字系统识别问题。由于图像质量低、背景复杂以及某些文字系统(如希腊文、拉丁文等)共享相似的字符布局,这些情形下的文本识别变得具有挑战性。本文提出一种新方法,利用 CNN-LSTM 框架提取局部和全局特征,并动态加权以进行文字系统识别。首先,我们将图像转换为图像块并输入 CNN-LSTM 框架。在 LSTM 后应用 softmax 层计算基于注意力的图像块权重。接下来,将这些权重与相应的 CNN 进行逐块相乘以得到局部特征。全局特征也从 LSTM 的最后一个单元状态中提取。我们采用一种融合技术,对单个图像块的局部和全局特征进行动态加权。实验在四个公开文字系统识别数据集上进行:SIW-13、CVSI2015、ICDAR-17 和 MLe2e。所提框架相比传统方法取得了更优的结果。
引用
@article{arxiv.1801.00470,
title = {Script Identification in Natural Scene Image and Video Frame using Attention based Convolutional-LSTM Network},
author = {Ankan Kumar Bhunia and Aishik Konwer and Ayan Kumar Bhunia and Abir Bhowmick and Partha P. Roy and Umapada Pal},
journal= {arXiv preprint arXiv:1801.00470},
year = {2018}
}
备注
The first and second authors contributed equally. Accepted in Pattern Recognition Journal