中文

SAML:面向端到端语音识别的演化适配型混合LoRA专家

声音 2024-07-01 v1 音频与语音处理

摘要

混合专家(Mixture-of-experts, MoE)模型在诸多任务中取得了优异成绩。然而,传统MoE模型往往非常庞大,难以部署在资源受限的边缘设备。本文提出一种新颖的演化适配型混合LoRA专家(Speaker Adaptive Mixture of LoRA Experts, SAML)方法, 使用低秩适应(LoRA)模块作为专家以减少MoE中的可训练参数数量。具体而言,SAML被应用于量化且个性化的端到端自动语音识别模型, 将测试时演化适配与模型压缩后的性能提升相结合,以提升特定说话人场景下的表现。在LibriSpeech和TED-LIUM 3语料库上进行实验。令人惊讶的是,相较于原始全精度模型,在量化后的Whisper模型和基于Conformer的注意力机制编码器解码器ASR模型上,分别实现了29.1%和31.1%的相对词错误率降低。

关键词

引用

@article{arxiv.2406.19706,
  title  = {SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR},
  author = {Qiuming Zhao and Guangzhi Sun and Chao Zhang and Mingxing Xu and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:2406.19706},
  year   = {2024}
}

备注

5 pages, accepted by Interspeech 2024. arXiv admin note: substantial text overlap with arXiv:2309.09136