中文

基于Transformer模型的阿拉伯语语音识别在SADA大型阿拉伯语语料库上的表现

音频与语音处理 2025-08-19 v1 机器学习

摘要

我们探讨了几类最先进自动语音识别(ASR)模型在大型阿拉伯语语音数据集SADA(沙特语音数据集 for Arabic)上的性能。该数据集包含来自沙特电视节目的668小时高质量音频,包括多种方言和环境,特别是噪声子集,使其对ASR尤其具挑战性。我们在SADA测试集上评估了模型性能,并探讨了微调、语言模型以及噪声和去噪对其性能的影响。我们发现,最佳性能模型是针对SADA进行4-gram语言模型微调的MMS 1B模型,在SADA测试干净集上实现了40.9%的词错误率(WER)和17.6%的字符错误率(CER)。

关键词

引用

@article{arxiv.2508.12968,
  title  = {Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models},
  author = {Branislav Gerazov and Marcello Politi and Sébastien Bratières},
  journal= {arXiv preprint arXiv:2508.12968},
  year   = {2025}
}