中文

将预训练语言模型蒸馏至多语言 ASR 模型

计算与语言 2022-06-28 v1 人工智能 声音 音频与语音处理

摘要

多语言语音数据常受长尾语言分布影响,导致性能下降。然而,多语言文本数据更易获取,从而能训练出更有用的通用语言模型。因此,我们致力于将训练良好的教师文本模型中所蕴含的丰富知识蒸馏到学生语音模型中。我们提出了一种称为将语言模型蒸馏到语音模型(Distill-L2S)的新方法,该方法对齐两种不同模态的潜在表示。细微差异通过收缩机制、最近邻插值以及一个可学习的线性投影层来处理。我们通过将该方法应用于多语言自动语音识别(ASR)任务来证明其有效性。我们在针对每种语言微调大规模多语言 ASR 模型(XLSR-wav2vec 2.0)的同时,蒸馏基于 transformer 的跨语言语言模型(InfoXLM)。我们在 CommonVoice 数据集中语音数据少于 100 小时的 20 种低资源语言上展示了我们方法的优越性。

关键词

引用

@article{arxiv.2206.12638,
  title  = {Distilling a Pretrained Language Model to a Multilingual ASR Model},
  author = {Kwanghee Choi and Hyung-Min Park},
  journal= {arXiv preprint arXiv:2206.12638},
  year   = {2022}
}

备注

Accepted to Interspeech 2022. Official implementation provided in https://github.com/juice500ml/xlm_to_xlsr