中文

Whisper 在多样化阿拉伯语语音识别上的 N-Shot 基准评测

计算与语言 2023-06-06 v1 声音 音频与语音处理

摘要

Whisper 是近期开发的多语言弱监督模型,据报道在单语与多语设定下的多个语音识别基准上表现良好。然而,即使在如阿拉伯语等其曾评估过的语言上,Whisper 在多样化条件下表现如何仍不清楚。本工作通过全面评估 Whisper 在多种阿拉伯语语音变体上的 ASR 任务来填补此空白。我们的评估覆盖大多数公开可用的阿拉伯语语音数据,并在 n-shot(零样本、少样本和全量)微调下执行。我们还研究了 Whisper 在完全新颖条件下的鲁棒性,如方言口音的标准阿拉伯语和未见方言,为此我们开发了评测数据。实验表明,尽管 Whisper 零样本在所有数据集上优于全量微调的 XLS-R 模型,但其在五个未见方言(即阿尔及利亚、约旦、巴勒斯坦、阿联酋和也门)的零样本设定下性能显著下降。

关键词

引用

@article{arxiv.2306.02902,
  title  = {N-Shot Benchmarking of Whisper on Diverse Arabic Speech Recognition},
  author = {Bashar Talafha and Abdul Waheed and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2306.02902},
  year   = {2023}
}

备注

4 pages, INTERSPEECH 2023