中文

Thiomi 数据集:面向低资源非洲语言的大规模多模态语料库

计算与语言 2026-04-07 v2 机器学习

摘要

我们介绍Thiomi 数据集,这是一个跨越十个非洲语言、涵盖四大语言家族的大规模多模态语料库:斯瓦希利语、吉克尤语、坎巴语、基梅鲁语、卢奥语、马赛语、基普西格斯语、索马里语(东非);乌尔法语(西非);及弗兰尼语(西非/中非)。数据集包含超过60.1万条获批的句子级文本标注和38.5万条音频录音,通过专门的社区数据收集平台收集,涉及超过100名贡献者。为验证数据集的实用性,我们训练并评估了语音识别 (ASR)、机器翻译 (MT) 与语音合成 (TTS) 模型,为所有语言建立了基线。我们最佳的ASR系统在斯瓦希利语上实现3.24% WER(使用Common Voice数据),将Prior学术SOTA从8.3%降至3.24%(绝对降低5.1个百分点,相对降低61%),并在索马里语上达到4.3% WER。该数据集将发布至HuggingFace。我们描述了数据收集平台、质量保证工作流程以及基线实验,并讨论了对非洲语言技术基础设施的影响。

关键词

引用

@article{arxiv.2603.29244,
  title  = {The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages},
  author = {Hillary Mutisya and John Mugane and Gavin Nyamboga and Brian Chege and Maryruth Gathoni},
  journal= {arXiv preprint arXiv:2603.29244},
  year   = {2026}
}