中文

面向低资源多口音自动语音识别的 LoRA 专家混合

计算与语言 2025-10-03 v1

摘要

我们旨在提高自动语音识别(ASR)系统对非母语语音的鲁棒性,特别是在低资源多口音场景下。我们引入了口音特定 LoRA 混合(MAS-LoRA),这是一种微调方法,利用了低秩自适应(LoRA)专家的混合,每个专家专门针对特定口音。在推理时,无论口音已知还是未知,该方法均可使用,无需再次微调模型。我们在 L2-ARCTIC 语料库上使用 Whisper 进行的实验表明,当口音未知时,与常规 LoRA 和全量微调相比,词错误率有显著改善。当口音已知时,结果进一步提升。此外,MAS-LoRA 表现出比其他微调方法更少的灾难性遗忘。据我们所知,这是首次将 LoRA 专家混合用于非母语多口音 ASR。

关键词

引用

@article{arxiv.2505.20006,
  title  = {Mixture of LoRA Experts for Low-Resourced Multi-Accent Automatic Speech Recognition},
  author = {Raphaël Bagat and Irina Illina and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:2505.20006},
  year   = {2025}
}

备注

Submitted to Interspeech 2025