基于局部语义引导的任意阅读顺序场景文本探测器
计算机视觉与模式识别
2024-12-16 v1
摘要
场景文本检测在近年来吸引了相对研究人员的关注。大多数现有的场景文本探测器遵循检测后识别范例,其中原始检测模块很难确定阅读顺序,导致识别失败。在重新思考自回归场景文本识别方法后,我们发现一个训练良好的识别器可以隐式感知整个单词或句子中所有字符的局部语义,而无需字符级别的检测模块。局部语义知识不仅包括文本内容,也包括正确阅读顺序中的空间信息。基于上述分析,我们提出了局部语义引导场景文本探测器(Local Semantics Guided Spotter, LSGSpotter),其通过局部语义自动解码字符的位置和内容。具体而言,LSGSpotter中提出了两个有效模块。一方面,我们设计了一个开始点定位模块(Start Point Localization Module, SPLM),用于定位文本开始点以确定正确的阅读顺序。另一方面,提出了多尺度自适应注意力模块(Multi-scale Adaptive Attention Module, MAAM),用于在局部区域自适应地聚合文本特征。总之,LSGSpotter在没有复杂检测限制的情况下完成了任意阅读顺序的检测任务,同时通过网格采样策略减轻了计算资源消耗。大量实验结果表明,LSGSpotter在InverseText基准数据集上实现了最佳业绩。此外,我们的探测器在英文基准数据集上表现出色,分别在Total-Text和SCUT-CTW1500上实现了0.7%和2.5%的提升。这些结果验证了我们的文本探测器在任意阅读顺序和形状的场景文本中是有效的。
引用
@article{arxiv.2412.10159,
title = {Arbitrary Reading Order Scene Text Spotter with Local Semantics Guidance},
author = {Jiahao Lyu and Wei Wang and Dongbao Yang and Jinwen Zhong and Yu Zhou},
journal= {arXiv preprint arXiv:2412.10159},
year = {2024}
}
备注
Accepted by AAAI2025