中文

通过 Whisper 微调克服多方言阿拉伯语 ASR 中的数据稀缺问题

计算与语言 2025-09-26 v1 声音 音频与语音处理

摘要

尽管商用阿拉伯语自动语音识别(ASR)系统支持现代标准阿拉伯语(MSA),但它们在处理方言语音时仍存在困难。我们研究了在五种主要阿拉伯语方言(海湾方言、黎凡特方言、伊拉克方言、埃及方言、马格里布方言)上微调 OpenAI 的 Whisper 的效果,其中使用 Mozilla Common Voice 作为 MSA 数据,使用 MASC 数据集作为方言语音数据。我们评估了 MSA 训练数据量的影响、在 MSA 数据上进行预训练的益处,以及特定方言模型与混合方言模型的对比。我们发现,少量的 MSA 微调数据可以为较小的模型带来显著提升,使其性能匹配未微调的较大模型。虽然 MSA 预训练显示出极小的益处,表明 MSA 与方言之间的共享特征有限,但我们的混合方言模型表现与特定方言模型相当。这表明,在适当平衡的情况下,混合方言数据有助于解决低资源 ASR 中的数据稀缺问题,且不会产生显著的性能损失。

关键词

引用

@article{arxiv.2506.02627,
  title  = {Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning},
  author = {Ömer Tarik Özyilmaz and Matt Coler and Matias Valdenegro-Toro},
  journal= {arXiv preprint arXiv:2506.02627},
  year   = {2025}
}

备注

Accepted at Interspeech 2025