应对低资源非洲 NLP 的艰难现实
计算与语言
2025-11-25 v1
摘要
创建面向低资源语言的语音数据集、模型和评估框架仍具有挑战性,这取决于缺乏广泛的相关经验。本文报告了从 Bambara(西非一种低资源语言)收集 612 小时自发语音的现场数据、使用半自动方式进行标注(包括转录)、基于该数据集创建多个单语 ultra-compact 和小型模型,并对其输出进行自动与人工评估。我们提供了数据收集、标注和模型设计的实用建议,并提供了进行人工评估的重要性证据。除主数据集外,多个评估数据集、模型和代码均公开可用。
引用
@article{arxiv.2511.18557,
title = {Dealing with the Hard Facts of Low-Resource African NLP},
author = {Yacouba Diarra and Nouhoum Souleymane Coulibaly and Panga Azazia Kamaté and Madani Amadou Tall and Emmanuel Élisé Koné and Aymane Dembélé and Michael Leventhal},
journal= {arXiv preprint arXiv:2511.18557},
year = {2025}
}
备注
10 pages, 4 figures