Linguistic More:迈向高效精准场景文本识别的进一步探索
计算机视觉与模式识别
2023-05-11 v2
摘要
视觉模型因在场景文本识别(STR)任务中的简洁与高效而受到越来越多的关注。然而,由于缺乏语言知识与信息的感知,近期的视觉模型面临两个问题:(1) 纯视觉-based的查询导致注意力漂移,通常造成识别不佳,本文将其归纳为语言不敏感漂移(LID)问题。(2) 在一些视觉缺失情形(如遮挡等)下,视觉特征对于识别是次优的。为解决这些问题,我们提出一种语言感知视觉模型(LPV),其探索视觉模型的语言能力以实现准确文本识别。为缓解LID问题,我们引入级联位置注意力(CPA)机制,通过逐步优化与语言信息挖掘获得高质量且准确的注意力图。此外,提出全局语言重建模块(GLRM),通过在视觉空间中感知语言信息来改善视觉特征的表示,其在级联过程中将视觉特征逐步转化为语义丰富的特征。与以往方法不同,我们的方法在保持低复杂度(仅8.11M参数达到92.4%准确率)的同时取得了SOTA结果。代码见 https://github.com/CyrilSterling/LPV。
引用
@article{arxiv.2305.05140,
title = {Linguistic More: Taking a Further Step toward Efficient and Accurate Scene Text Recognition},
author = {Boqiang Zhang and Hongtao Xie and Yuxin Wang and Jianjun Xu and Yongdong Zhang},
journal= {arXiv preprint arXiv:2305.05140},
year = {2023}
}
备注
Accepted to IJCAI 2023