多语言自然场景文本检测算法研究
计算机视觉与模式识别
2024-01-08 v2
摘要
自然场景文本检测是计算机视觉中的一个重大挑战,在多语言、多样化和复杂的文本场景中具有巨大的应用潜力。我们提出了一种多语言文本检测模型,以解决自然场景中多语言文本检测精度低和难度高的问题。针对具有多个字符集和各种字体风格的多语言文本图像所带来的挑战,我们引入了 SFM Swin Transformer 特征提取网络,以增强模型在不同语言间检测字符和字体的鲁棒性。针对自然场景文本图像中文本尺度的巨大变化和复杂排列,我们通过结合自适应空间特征融合模块和空间金字塔池化模块,提出了 AS-HRFPN 特征融合网络。特征融合网络的改进增强了模型检测文本尺寸和方向的能力。解决多语言场景文本图像中多样的背景和字体变化是现有方法面临的挑战。有限的局部感受野阻碍了检测性能。为了克服这一点,我们提出了全局语义分割分支,提取并保留全局特征以实现更有效的文本检测,符合对全面信息的需求。在本研究中,我们收集并构建了一个真实世界的多语言自然场景文本图像数据集,并进行了全面的实验和分析。实验结果表明,所提出的算法实现了 85.02\% 的 F-measure,比基线模型高出 4.71\%。我们还在 MSRA-TD500、ICDAR2017MLT 和 ICDAR2015 数据集上进行了广泛的跨数据集验证,以验证我们方法的通用性。代码和数据集可在 https://github.com/wangmelon/CEMLT 找到。
引用
@article{arxiv.2312.11153,
title = {Research on Multilingual Natural Scene Text Detection Algorithm},
author = {Tao Wang},
journal= {arXiv preprint arXiv:2312.11153},
year = {2024}
}
备注
Sorry, we discovered certain mistake and asked that the current version be removed in order to perform a thorough reanalysis