第一套斯瓦希里语场景文本检测与识别数据集
计算机视觉与模式识别
2024-05-21 v1
摘要
场景文本识别是许多应用中的关键任务,包括自动翻译、信息检索、驾驶辅助以及增强视力受损者的可访问性。为提高场景文本检测和识别模型的准确率和性能,已有大量研究。然而,这些研究大多针对最常见的语言——英语和中文,低资源语言(尤其是斯瓦希里语)存在显著缺口。斯瓦希里语在东非多国广泛使用,但在场景文本识别领域仍属未充分探索的语言。目前尚无针对斯瓦希里语自然场景文本检测与识别的研究,且没有公开可用的数据集。我们提出了一个包含斯瓦希里语场景文本图像的综合数据集,并在不同场景文本检测与识别模型上进行评估。该数据集包含 976 张不同地点、不同环境下的图像,每张图像都有基于单词级别的标注。该数据集可作为斯瓦希里语场景文本检测与识别的基准数据集,用于评估和比较不同方法,推动后续研究的开展。该数据集通过 GitHub 链接公开提供:https://github.com/FadilaW/Swahili-STR-Dataset
引用
@article{arxiv.2405.11437,
title = {The First Swahili Language Scene Text Detection and Recognition Dataset},
author = {Fadila Wendigoundi Douamba and Jianjun Song and Ling Fu and Yuliang Liu and Xiang Bai},
journal= {arXiv preprint arXiv:2405.11437},
year = {2024}
}
备注
Accepted to ICDAR 2024