面向低资源多口音自动语音识别的 LoRA 专家混合
计算与语言
2025-10-03 v1
摘要
我们旨在提高自动语音识别(ASR)系统对非母语语音的鲁棒性,特别是在低资源多口音场景下。我们引入了口音特定 LoRA 混合(MAS-LoRA),这是一种微调方法,利用了低秩自适应(LoRA)专家的混合,每个专家专门针对特定口音。在推理时,无论口音已知还是未知,该方法均可使用,无需再次微调模型。我们在 L2-ARCTIC 语料库上使用 Whisper 进行的实验表明,当口音未知时,与常规 LoRA 和全量微调相比,词错误率有显著改善。当口音已知时,结果进一步提升。此外,MAS-LoRA 表现出比其他微调方法更少的灾难性遗忘。据我们所知,这是首次将 LoRA 专家混合用于非母语多口音 ASR。
引用
@article{arxiv.2505.20006,
title = {Mixture of LoRA Experts for Low-Resourced Multi-Accent Automatic Speech Recognition},
author = {Raphaël Bagat and Irina Illina and Emmanuel Vincent},
journal= {arXiv preprint arXiv:2505.20006},
year = {2025}
}
备注
Submitted to Interspeech 2025