中文

学习与保持:为自动语音识别基础模型添加新语言

音频与语音处理 2024-09-25 v3 计算与语言 机器学习 声音

摘要

自动语音识别(ASR)基础模型通常支持多种语言,例如 Whisper 支持 100 多种语言。然而,如何在新增一种通常资源较少的语言时,同时维持原有语言集合的性能,却有少量研究工作。微调虽然简单,但可能导致原有语言准确率下降。我们比较了三种利用适应参数的 method:软语言编码调优、仅训练语言编码;软提示调优、训练前置 token;以及 LoRA,其中优化一小部分额外参数。弹性权重整合(EWC)提供了一种替代性折中方案, potentially 在特定目标语言上维持性能。结果表明,直接微调对新语言性能最佳,但会损害原有语言能力。EWC 可解决此问题于特定语言。如果仅使用适应参数,语言能力得以维持,但以牺牲新语言性能为代价。

关键词

引用

@article{arxiv.2407.06800,
  title  = {Learn and Don't Forget: Adding a New Language to ASR Foundation Models},
  author = {Mengjie Qian and Siyuan Tang and Rao Ma and Kate M. Knill and Mark J. F. Gales},
  journal= {arXiv preprint arXiv:2407.06800},
  year   = {2024}
}

备注

Proceedings of Interspeech