基于设备端空间注意力的序列学习方法用于场景文本文字系统识别
计算机视觉与模式识别
2021-12-02 v1
摘要
文字系统的自动识别是多语言 OCR 引擎的重要组成部分。本文提出一种高效、轻量、实时且基于设备端空间注意力的 CNN-LSTM 网络,用于场景文本文字系统识别,可在资源受限的移动设备上部署。我们的网络由一个 CNN 构成,配备空间注意力模块,有助于减小自然图像中存在的空间畸变。这使得特征提取器能够生成丰富的图像表示,同时忽略形变,从而提升这一细粒度分类任务的性能。该网络还采用残差卷积块构建深层网络,以聚焦于文字系统的判别性特征。CNN 通过识别每个字符所属的特定文字系统来学习文本特征表示,而文本内的长期空间依赖则由 LSTM 层的序列学习能力捕获。将空间注意力机制与残差卷积块结合,我们得以增强基线 CNN 的性能,构建端到端可训练的文字系统识别网络。在多个标准基准上的实验结果证明了本方法的有效性。该网络取得了与 SOTA 方法相竞争的准确率,并且在网络规模上更优,总参数量仅 110 万,推理时间为 2.7 毫秒。
引用
@article{arxiv.2112.00448,
title = {On-Device Spatial Attention based Sequence Learning Approach for Scene Text Script Identification},
author = {Rutika Moharir and Arun D Prabhu and Sukumar Moharana and Gopi Ramena and Rachit S Munjal},
journal= {arXiv preprint arXiv:2112.00448},
year = {2021}
}
备注
Accepted for publication in CVIP 2021