FACLSTM:面向场景文本识别的聚焦注意力卷积LSTM
计算机视觉与模式识别
2020-01-07 v2
摘要
场景文本识别近来被广泛视为序列到序列预测问题,其中传统的全连接LSTM(FC-LSTM)发挥了关键作用。由于FC-LSTM的局限性,现有方法必须将二维特征图转换为一维序列特征向量,导致文本图像宝贵的空间与结构信息严重受损。本文认为,鉴于其二维图像输入,场景文本识别本质上是一个时空预测问题,并提出了一种基于卷积LSTM(ConvLSTM)的场景文本识别器,即FACLSTM(Focused Attention ConvLSTM,聚焦注意力卷积LSTM),其在利用LSTM进行序列预测时充分挖掘像素间的空间相关性。特别地,注意力机制通过卷积操作被恰当地融入高效的ConvLSTM结构中,并额外生成字符中心掩码以帮助将注意力聚焦于正确的特征区域。在基准数据集IIIT5K、SVT和CUTE上的实验结果表明,我们所提出的FACLSTM在规则、低分辨率和含噪文本图像上表现具有竞争力,并在弯曲文本上以较大优势超越最先进的方法。
引用
@article{arxiv.1904.09405,
title = {FACLSTM: ConvLSTM with Focused Attention for Scene Text Recognition},
author = {Qingqing Wang and Wenjing Jia and Xiangjian He and Yue Lu and Michael Blumenstein and Ye Huang},
journal= {arXiv preprint arXiv:1904.09405},
year = {2020}
}
备注
Accepted by Science China Information Science