HDMoLE:用于微调基于 LLM 的语音识别模型的层次化路由和动态阈值的 LoRA 专家混合
声音
2025-01-06 v3 音频与语音处理
摘要
最近的进展在将大型语言模型 (LLM) 与自动语音识别 (ASR) 集成方面在通用领域表现卓越。尽管对所有模型参数进行的监督微调 (SFT) 常用于将预训练的 LLM-based ASR 模型适应特定领域,但这会带来高计算成本并显著降低其在通用领域的性能。本文提出了一种名为 HDMoLE 的新型参数高效的多域微调方法,用于适配预训练的 LLM-based ASR 模型以适应多方言领域且不忘记源领域,该方法利用层次化路由和动态阈值,将低秩适应 (LoRA) 与专家混合 (MoE) 结合,并可推广至任何线性层。层次化路由在 LoRA 专家和方言域之间建立清晰的对应关系,提高了 LoRA 专家之间的跨域协作。与在每个 MoE 层上激活 LoRA 专家的静态 Top-K 策略不同,动态阈值可以在每个 MoE 层自适应地激活不同数量的 LoRA 专家。在多方言和标准普通话数据集上的实验表明,HDMoLE 的有效性。将 HDMoLE 应用于 LLM-based ASR 模型的投影模块,可实现对目标多方言领域中与完全微调相似的性能,仅使用完全微调所需参数的 9.6%,且在源通用领域几乎没有性能下降。
引用
@article{arxiv.2409.19878,
title = {HDMoLE: Mixture of LoRA Experts with Hierarchical Routing and Dynamic Thresholds for Fine-Tuning LLM-based ASR Models},
author = {Bingshen Mu and Kun Wei and Qijie Shao and Yong Xu and Lei Xie},
journal= {arXiv preprint arXiv:2409.19878},
year = {2025}
}
备注
Accepted by ICASSP 2025