通过 LoRA 语言专家实现高效多语言 ASR 微调
计算与语言
2025-06-30 v1 声音
音频与语音处理
摘要
深度学习的 recent 进展显著增强了多语言自动语音识别(ASR),这得益于先进的模型架构和可获得的大规模多语言数据集。尽管如此,多语言 ASR 仍然受到多语言诅咒的困扰,不同语言倾向于相互干扰,使得 ASR 模型在共享模型容量的同时难以有效识别多个语言。本文提出了一种基于 Whisper 的高效微调框架,用于定制化多语言 ASR,通过准备 LoRA 语言专家实现。通过 LoRA 专家融合或知识蒸馏,我们的方法在目标语言上实现了优于标准微调方法的更好识别性能。实验结果表明,所提出的模型在语言感知和语言非感知场景分别实现约 10% 和 15% 的相对性能提升。
引用
@article{arxiv.2506.21555,
title = {Efficient Multilingual ASR Finetuning via LoRA Language Experts},
author = {Jiahong Li and Yiwen Shao and Jianheng Zhuo and Chenda Li and Liliang Tang and Dong Yu and Yanmin Qian},
journal= {arXiv preprint arXiv:2506.21555},
year = {2025}
}
备注
Accepted in Interspeech 2025