中文

面向无排练式多语言语音识别:基于LoRA的Whisper案例研究

计算与语言 2024-08-21 v1 声音 音频与语音处理

摘要

预训练的多语言语音基础模型(如Whisper)在不同语言上展现了令人瞩目的性能。然而,将这些模型适配到新语言或特定语言需要大量计算资源,并面临灾难性遗忘问题。针对这些问题,本研究探讨了在没有原始训练数据的情况下增强模型对新语言的能力,同时保持对原始语言的已有性能。具体而言,我们首先比较了各种基于LoRA的方法以找出其对遗忘的脆弱性。为缓解此问题,我们提出利用原始模型的LoRA参数对新样本进行近似正交梯度下降。此外,我们还引入了一个可学习的秩系数来分配可训练参数,以实现更高效的训练。在中文Whisper模型(针对维吾尔语和藏语)上的实验表明,使用更紧凑的参数集即可获得更好的结果。

关键词

引用

@article{arxiv.2408.10680,
  title  = {Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper},
  author = {Tianyi Xu and Kaixun Huang and Pengcheng Guo and Yu Zhou and Longtao Huang and Hui Xue and Lei Xie},
  journal= {arXiv preprint arXiv:2408.10680},
  year   = {2024}
}