中文

蒸馏还是不蒸馏?论稳健知识蒸馏的鲁棒性

计算与语言 2024-06-10 v1 声音 音频与语音处理

摘要

阿拉伯语以其独特的自动语音识别(ASR)挑战而闻名。一方面,其丰富的语言多样性和广泛的方言使开发稳健、包容的模型变得复杂。另一方面,当前的多语言 ASR 模型计算密集且缺乏全面的评估。鉴于这些挑战,我们将知识从大型教师模型蒸馏到更高效的小型学生变体中。我们还引入了一个新颖的人工标注数据集,涵盖五种代表性不足的阿拉伯方言用于评估。我们进一步评估了我们的模型和现有的最先进多语言模型在标准可用基准和我们新的方言数据上的表现。我们最佳蒸馏模型的整体性能(45.0%45.0\% 词错误率)超过了其两倍大小的最先进模型(SeamlessM4T-large-v2,WER=47.0%47.0\%)及其教师模型(Whisper-large-v2,WER=55.1%55.1\%),并且在我们新的方言数据上的平均性能(56.9%56.9\% WER)优于所有其他模型。为了更深入了解这些模型在方言数据上表现不佳的原因,我们进行了错误分析,并报告了不同模型倾向于犯的主要错误类型。项目的 GitHub 仓库地址为 \url{https://github.com/UBC-NLP/distill-whisper-ar}。

关键词

引用

@article{arxiv.2406.04512,
  title  = {To Distill or Not to Distill? On the Robustness of Robust Knowledge Distillation},
  author = {Abdul Waheed and Karima Kadaoui and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2406.04512},
  year   = {2024}
}

备注

Accepted at ACL'24 main