Whisper 在多样化阿拉伯语语音识别上的 N-Shot 基准评测
计算与语言
2023-06-06 v1 声音
音频与语音处理
摘要
Whisper 是近期开发的多语言弱监督模型,据报道在单语与多语设定下的多个语音识别基准上表现良好。然而,即使在如阿拉伯语等其曾评估过的语言上,Whisper 在多样化条件下表现如何仍不清楚。本工作通过全面评估 Whisper 在多种阿拉伯语语音变体上的 ASR 任务来填补此空白。我们的评估覆盖大多数公开可用的阿拉伯语语音数据,并在 n-shot(零样本、少样本和全量)微调下执行。我们还研究了 Whisper 在完全新颖条件下的鲁棒性,如方言口音的标准阿拉伯语和未见方言,为此我们开发了评测数据。实验表明,尽管 Whisper 零样本在所有数据集上优于全量微调的 XLS-R 模型,但其在五个未见方言(即阿尔及利亚、约旦、巴勒斯坦、阿联酋和也门)的零样本设定下性能显著下降。
引用
@article{arxiv.2306.02902,
title = {N-Shot Benchmarking of Whisper on Diverse Arabic Speech Recognition},
author = {Bashar Talafha and Abdul Waheed and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2306.02902},
year = {2023}
}
备注
4 pages, INTERSPEECH 2023