非洲低资源语言自动语音识别(ASR):系统性文献综述
计算与语言
2025-10-02 v1
摘要
自动语音识别(ASR)在全球范围内取得了显著的进展,但非洲低资源语言严格处于欠representative状态,导致该大陆超过2000种语言的数字包容性受到阻碍。本系统性文献综述(SLR)聚焦于非洲语言的ASR研究,重点探讨数据集、模型与训练方法、评估技术、挑战及未来发展方向。我们遵循PRISMA 2020程序,在DBLP、ACM Digital Library、Google Scholar、Semantic Scholar和arXiv等数据库中检索2020年1月至2025年7月间的文献。纳入条件为涉及非洲语言ASR数据集、模型或指标的研究,排除非非洲、重复及质量低于3/5的文献。最终筛选出71篇2062条记录中的74个数据集,覆盖111种语言,约为11,206小时语音。不足15%的研究提供了可复现的材料,且数据集许可证不明确。自监督学习和迁移学习技术前景可期,但受限于预训练数据有限、方言覆盖不足及资源可得性不足。大多数研究者使用词错误率(WER),对字符错误率(CER)或音调错误率(DER)等语言学相关指标的使用极少,导致在语音调值语言和形态丰富语言中的应用受限。现有ASR系统证据不一,受数据集可用性、标注质量、许可证不确定及基准测试不足等问题影响。尽管如此,社区驱动的倡议及方法学进步表明了改进之路。可持续发展还需包括利益相关者合作、创建伦理平衡的数据集、采用轻量级建模技术以及积极进行基准测试。
引用
@article{arxiv.2510.01145,
title = {Automatic Speech Recognition (ASR) for African Low-Resource Languages: A Systematic Literature Review},
author = {Sukairaj Hafiz Imam and Tadesse Destaw Belay and Kedir Yassin Husse and Ibrahim Said Ahmad and Idris Abdulmumin and Hadiza Ali Umar and Muhammad Yahuza Bello and Joyce Nakatumba-Nabende and Seid Muhie Yimam and Shamsuddeen Hassan Muhammad},
journal= {arXiv preprint arXiv:2510.01145},
year = {2025}
}