Ethio-ASR:厄洛蒙多语言语音识别与语言识别联合模型
计算与语言
2026-03-26 v1
摘要
我们提出 Ethio-ASR,一套针对埃洛蒙语言家族的五大语言:阿姆哈拉语、提格尼亚语、奥罗米语、西达马语和沃莱塔语的多语言 CTC 自动语音识别 (ASR) 模型联合训练套件。这些语言分别属于阿非色语族的 Semitic、Cushitic 和 Omotic 分支,尽管占据埃洛蒙人口总数的主导地位,却在语音技术中严重不足。我们在新发布的 WAXAL 语料库上训练模型,使用多种预训练语音编码器,并对抗韧性强的多语言基线包括 OmniASR 进行评估。我们最佳模型在 WAXAL 测试集上实现平均 WER 为 30.48%,优于参数更少的 OmniASR 最佳模型。我们进一步提供关于性别偏见、元音长度与辅音重化对 ASR 错误的影响以及多语言 CTC 模型训练动力学的全面分析。我们的模型和代码已公开供研究社区使用。
引用
@article{arxiv.2603.23654,
title = {Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages},
author = {Badr M. Abdullah and Israel Abebe Azime and Atnafu Lambebo Tonja and Jesujoba O. Alabi and Abel Mulat Alemu and Eyob G. Hagos and Bontu Fufa Balcha and Mulubrhan A. Nerea and Debela Desalegn Yadeta and Dagnachew Mekonnen Marilign and Amanuel Temesgen Fentahun and Tadesse Kebede and Israel D. Gebru and Michael Melese Woldeyohannis and Walelign Tewabe Sewunetie and Bernd Möbius and Dietrich Klakow},
journal= {arXiv preprint arXiv:2603.23654},
year = {2026}
}
备注
Preprint (under review)