中文

自然场景图像中的乌尔都语文本:一个新数据集与初步文本检测

计算机视觉与模式识别 2021-09-17 v1 机器学习 图像与视频处理

摘要

自然场景图像中用于内容分析的文本检测是一项有趣的任务。研究界在英语/普通话文本检测方面已取得了一些重大进展。然而,自然场景图像中的乌尔都语文本提取是一项尚未得到很好解决的 task。在这项工作中,首先引入了一个用于自然场景图像中乌尔都语文本的新数据集。该数据集包含从真实场景获取的500张独立图像。其次,应用通道增强的最大稳定极值区域(MSER)方法来提取图像中作为候选的乌尔都语文本区域。采用两阶段过滤机制来消除非候选区域。在第一阶段,根据几何属性对文本和噪声进行分类。在第二阶段,训练一个支持向量机分类器以丢弃非文本候选区域。此后,使用基于质心的垂直和水平距离将文本候选区域进行连接。文本行进一步由基于HOG特征的不同分类器分析以去除非文本区域。在本地开发的数据集上进行了大量实验以评估性能。实验结果显示在测试集图像上具有良好的性能。该数据集将可供研究使用。据我们所知,该工作是乌尔都语同类任务中的首项工作,并将提供一个可供自由研究使用的良好数据集,并作为乌尔都语文本提取任务的基线性能。

关键词

引用

@article{arxiv.2109.08060,
  title  = {Urdu text in natural scene images: a new dataset and preliminary text detection},
  author = {Hazrat Ali and Khalid Iqbal and Ghulam Mujtaba and Ahmad Fayyaz and Mohammad Farhad Bulbul and Fazal Wahab Karam and Ali Zahir},
  journal= {arXiv preprint arXiv:2109.08060},
  year   = {2021}
}