中文

AfriVoices-KE:肯尼亚多语言语音数据集

计算与语言 2026-04-10 v1

摘要

AfriVoices-KE是一个大规模多语言语音数据集,包含约3000小时的音频,覆盖肯尼亚的五种语言:Dholuo、Kikuyu、Kalenjin、Maasai和Somali。该数据集包括750小时的脚本化语音和2250小时的自发语音,来自4777名母语说话人,覆盖各地区和人口统计学特征。本工作解决了非洲语言在语音技术中的严重缺乏问题,提供了高质量、语言多样性资源。数据收集遵循双重方法:脚本化录音取自编译的文本语料库、翻译和跨越肯尼亚语境中十一个领域的生成句子;而非脚本化语音则通过文本和图像提示来捕获自然语言变异和方言细微差别。定制的移动应用程序使贡献者能够使用智能手机进行录音。质量保证在多个层面上进行,包括录音前的自动信噪比验证以及人工审核的内容准确性。尽管项目在低资源环境中遇到了常见挑战,包括基础设施不可靠、设备兼容性问题和社区信任障碍,但通过当地组织者、利益相关者合作和自适应训练协议得以缓解。AfriVoices-KE为开发包容性自动语音识别和文本转语音系统提供了基础资源,同时推动了肯尼亚语言遗产的数字保存。

关键词

引用

@article{arxiv.2604.08448,
  title  = {AfriVoices-KE: A Multilingual Speech Dataset for Kenyan Languages},
  author = {Lilian Wanzare and Cynthia Amol and zekiel Maina and Nelson Odhiambo and Hope Kerubo and Leila Misula and Vivian Oloo and Rennish Mboya and Edwin Onkoba and Edward Ombui and Joseph Muguro and Ciira wa Maina and Andrew Kipkebut and Alfred Omondi Otom and Ian Ndung'u Kang'ethe and Angela Wambui Kanyi and Brian Gichana Omwenga},
  journal= {arXiv preprint arXiv:2604.08448},
  year   = {2026}
}

备注

10 pages, 5 figures, 3 tables