一种由整体表征引导的注意力网络用于场景文本识别
计算机视觉与模式识别
2021-03-31 v5
摘要
尽管近期取得了进展,在自然图像中读取任意形状的不规则场景文本仍然是一个具有挑战性的问题。许多现有方法引入复杂的网络结构以处理各种形状,使用额外的标注以增强监督,或采用难以训练的循环神经网络进行序列建模。在本工作中,我们提出了一种简单而强大的场景文本识别方法。无需将输入图像转换为序列表示,我们直接将二维CNN特征连接到由整体表征引导的基于注意力的序列解码器。整体表征能够引导基于注意力的解码器聚焦于更精确的区域。由于未采用循环模块,我们的模型可以并行训练。与RNN对应模型相比,其反向传播实现了1.5倍至9.4倍的加速,前向传播实现了1.3倍至7.9倍的加速。所提出的模型仅使用词级标注进行训练。凭借这一简洁设计,我们的方法在受评估的规则与不规则场景文本基准数据集上取得了最先进或具竞争力的识别性能。
引用
@article{arxiv.1904.01375,
title = {A Holistic Representation Guided Attention Network for Scene Text Recognition},
author = {Lu Yang and Fan Dang and Peng Wang and Hui Li and Zhen Li and Yanning Zhang},
journal= {arXiv preprint arXiv:1904.01375},
year = {2021}
}