SAML:面向端到端语音识别的演化适配型混合LoRA专家
声音
2024-07-01 v1 音频与语音处理
摘要
混合专家(Mixture-of-experts, MoE)模型在诸多任务中取得了优异成绩。然而,传统MoE模型往往非常庞大,难以部署在资源受限的边缘设备。本文提出一种新颖的演化适配型混合LoRA专家(Speaker Adaptive Mixture of LoRA Experts, SAML)方法, 使用低秩适应(LoRA)模块作为专家以减少MoE中的可训练参数数量。具体而言,SAML被应用于量化且个性化的端到端自动语音识别模型, 将测试时演化适配与模型压缩后的性能提升相结合,以提升特定说话人场景下的表现。在LibriSpeech和TED-LIUM 3语料库上进行实验。令人惊讶的是,相较于原始全精度模型,在量化后的Whisper模型和基于Conformer的注意力机制编码器解码器ASR模型上,分别实现了29.1%和31.1%的相对词错误率降低。
引用
@article{arxiv.2406.19706,
title = {SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR},
author = {Qiuming Zhao and Guangzhi Sun and Chao Zhang and Mingxing Xu and Thomas Fang Zheng},
journal= {arXiv preprint arXiv:2406.19706},
year = {2024}
}
备注
5 pages, accepted by Interspeech 2024. arXiv admin note: substantial text overlap with arXiv:2309.09136