基于 Whisper 的稀疏共享 LoRA 用于儿童语音识别
音频与语音处理
2024-01-09 v2 声音
摘要
Whisper 是一个强大的自动语音识别(ASR)模型。然而,其在低资源语音上的零样本性能仍有待提升。儿童语音作为低资源语音的代表类型,被用于自适应微调。近来,自然语言处理(NLP)中的参数高效微调(PEFT)被证明可与全量微调相媲美甚至更优,同时仅需调整一小部分可训练参数。然而,当前的 PEFT 方法在 Whisper 上的有效性尚未得到充分检验。本文仅研究不带来额外推理成本的 PEFT 参数组合类型,如 LoRA 和 Bitfit。我们考察了多种流行的 PEFT 方法。特别地,我们比较了 LoRA 与 AdaLoRA,发现可学习秩系数是一种良好的设计。受 AdaLoRA 所分配稀疏秩分布的启发,我们提出了一种新颖的 PEFT 方法——稀疏共享 LoRA(Sparsely Shared LoRA,S2-LoRA)。两个低秩分解矩阵被全局共享,每个权重矩阵只需维护其特定的、被约束为稀疏的秩系数。在低资源中文儿童语音上的实验表明,以远更少的可训练参数,S2-LoRA 能取得与 AdaLoRA 相当的域内自适应性能,并在域外数据上展现出更好的泛化能力。此外,我们发现 S2-LoRA 自动学习到的秩分布与 AdaLoRA 的分配具有相似模式。
引用
@article{arxiv.2309.11756,
title = {Sparsely Shared LoRA on Whisper for Child Speech Recognition},
author = {Wei Liu and Ying Qin and Zhiyuan Peng and Tan Lee},
journal= {arXiv preprint arXiv:2309.11756},
year = {2024}
}
备注
Accepted by ICASSP 2024