面向孟加拉语招牌地址信息的检测、识别与解析:一种基于深度学习的方法
计算机视觉与模式识别
2023-11-23 v1
摘要
从自然场景图像中检索文本信息是计算机视觉领域中具有众多实际应用的研究热点。由于真实自然场景图像中存在反光、光照不均或阴影等特殊特性,检测文本区域并从招牌中提取文本是一项具有挑战性的问题。随着基于深度学习的方法的出现,人们提出了不同的精细技术用于自然场景中的文本检测与文本识别。尽管已有大量工作致力于英语等资源丰富语言的自然场景文本提取,但对于孟加拉语等低资源语言的研究甚少。在本研究中,我们提出了一种基于深度学习模型的端到端系统,用于高效检测、识别、校正并解析孟加拉语招牌中的地址信息。我们创建了人工标注数据集与合成数据集,以训练招牌检测、地址文本检测、地址文本识别、地址文本校正以及地址文本解析模型。我们对不同的基于CTC与编码器-解码器模型架构进行了孟加拉语地址文本识别的对比研究。此外,我们设计了一种基于序列到序列Transformer网络的新型地址文本校正模型,通过后置校正提升孟加拉语地址文本识别模型的性能。最后,我们利用最先进的基于Transformer的预训练语言模型开发了孟加拉语地址文本解析器。
引用
@article{arxiv.2311.13222,
title = {Towards Detecting, Recognizing, and Parsing the Address Information from Bangla Signboard: A Deep Learning-based Approach},
author = {Hasan Murad and Mohammed Eunus Ali},
journal= {arXiv preprint arXiv:2311.13222},
year = {2023}
}