利用机器学习助力低资源语言:乌尔都语文本检测进展
计算机视觉与模式识别
2022-09-29 v1 人工智能
机器学习
图像与视频处理
摘要
自然场景图像中的文本检测可应用于自动驾驶、为老年人与盲人的导航辅助。然而,乌尔都语文本检测的研究常受数据资源匮乏的阻碍。我们构建了一个含乌尔都语文本的场景图像数据集。我们展示了利用机器学习方法从场景图像中检测乌尔都语文本。我们使用通道增强的最大稳定极值区域(MSER)方法提取文本区域。首先,基于几何属性对文本与噪声分类。接着,我们使用支持向量机提前丢弃非文本区域。为进一步去除非文本区域,我们利用所得的方向梯度直方图(HoG)特征训练第二个SVM分类器。这提升了场景图像中文本区域检测的整体性能。为支持乌尔都语文本研究,我们旨在将数据免费开放供研究使用。我们也旨在凸显乌尔都语文本检测的挑战与研究空白。
引用
@article{arxiv.2209.14022,
title = {Leveraging machine learning for less developed languages: Progress on Urdu text detection},
author = {Hazrat Ali},
journal= {arXiv preprint arXiv:2209.14022},
year = {2022}
}
备注
Accepted at NeurIPS ML4D workshop. arXiv admin note: text overlap with arXiv:2109.08060