阿姆哈拉语场景文本检测与识别的综合基准数据集
计算机视觉与模式识别
2022-04-12 v1
摘要
埃塞俄比亚/阿姆哈拉文字是非洲最古老的书写系统之一,为东非至少 23 种语言(如阿姆哈拉语、提格里尼亚语)的超过 1.2 亿人提供服务。阿姆哈拉书写系统 Abugida 包含 282 个音节、15 个标点符号和 20 个数字。阿姆哈拉语音节矩阵由 34 个基本字素/辅音派生而来,通过为字符添加最多 12 个适当的变音符号或元音标记构成。具有共同辅音或元音标记的音节在视觉上可能相似,给文本识别任务带来挑战。本工作中,我们提出了首个综合公开数据集 HUST-ART、HUST-AST、ABE 和 Tana,用于自然场景中的阿姆哈拉文字检测与识别。我们还进行了大量实验,以评估 SOTA 方法在我们的数据集上检测和识别阿姆哈拉场景文本的性能。评估结果表明了我们的数据集用于基准测试的鲁棒性,以及推动鲁棒阿姆哈拉文字检测与识别算法发展的潜力。因此,该成果将惠及东非人民,包括来自若干国家的外交人员与国际社会。
引用
@article{arxiv.2203.12165,
title = {Comprehensive Benchmark Datasets for Amharic Scene Text Detection and Recognition},
author = {Wondimu Dikubab and Dingkang Liang and Minghui Liao and Xiang Bai},
journal= {arXiv preprint arXiv:2203.12165},
year = {2022}
}
备注
2 pages 1 figure 1 supplementary document