中文

结合无监督与文本增强半监督学习的低资源自回归语音识别

计算与语言 2022-02-14 v2 声音 音频与语音处理

摘要

无监督表示学习的最新进展展示了在大量朗读语音上预训练的影响。我们将这些技术应用于低资源(就数据和计算而言)对话与广播领域的域适应。超越 CTC,我们以无监督方式预训练最先进的 Conformer 模型。虽然无监督方法优于传统半监督训练,但这些技术是互补的。相较于单独半监督训练,结合这些技术在所有条件下平均词错率(WER)绝对提升 5%。额外文本数据通过外部语言模型引入。通过使用基于 CTC 的解码,我们能够更好地利用额外文本数据。当用作转写模型时,它使 Conformer 模型通过半监督训练比浅融合更好地融入语言模型的知识。与使用浅融合相比,基于 CTC 解码用于半监督训练时最终性能绝对再提升 2%。

关键词

引用

@article{arxiv.2110.15836,
  title  = {Combining Unsupervised and Text Augmented Semi-Supervised Learning for Low Resourced Autoregressive Speech Recognition},
  author = {Chak-Fai Li and Francis Keith and William Hartmann and Matthew Snover},
  journal= {arXiv preprint arXiv:2110.15836},
  year   = {2022}
}

备注

5 pages, minor changes for camera ready version, to be published in IEEE ICASSP 2022