中文

Sagalee:一个面向奥罗莫语的开源自动语音识别数据集

计算与语言 2025-02-04 v1 声音 音频与语音处理

摘要

我们提出了一个面向奥罗莫语(一种在埃塞俄比亚及邻近地区广泛使用的语言)的新型自动语音识别 (ASR) 数据集。该数据集通过众包方式收集,涵盖了多样化的说话人和语音变体。它包含 100 小时的真实世界音频录音及其对应的转录文本,覆盖了干净和嘈杂环境下的朗读语音。该数据集解决了奥罗莫语这一代表性不足的语言对 ASR 资源的迫切需求。为了展示其在 ASR 任务上的适用性,我们使用 Conformer 模型进行了实验,在使用混合 CTC 和 AED 损失时取得了 15.32% 的词错误率 (WER),在使用纯 CTC 损失时取得了 18.74% 的 WER。此外,对 Whisper 模型进行微调后,WER 显著提升至 10.82%。这些结果为奥罗莫语 ASR 建立了基线,同时凸显了提升奥罗莫语 ASR 性能所面临的挑战与潜力。该数据集已在 https://github.com/turinaf/sagalee 公开,我们鼓励将其用于奥罗莫语语音处理的进一步研究和开发。

关键词

引用

@article{arxiv.2502.00421,
  title  = {Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language},
  author = {Turi Abu and Ying Shi and Thomas Fang Zheng and Dong Wang},
  journal= {arXiv preprint arXiv:2502.00421},
  year   = {2025}
}

备注

Accepted for ICASSP2025 (2025 IEEE International Conference on Acoustics, Speech, and Signal Processing)