中文

子词相关模型尺度的自动学习

计算与语言 2021-10-19 v1 声音 音频与语音处理

摘要

为了提升最先进自动语音识别系统的性能,通常的做法是引入外部知识源,如语言模型或先验修正。这通常通过对数线性模型组合来实现,并为每个模型使用单独的缩放参数。通常,这些参数是在一些留存数据上进行人工优化的。在这项工作中,我们提出通过自动微分和随机梯度下降来优化这些缩放参数,类似于神经网络模型参数。我们在 LibriSpeech (LBS) 和 Switchboard (SWB) 语料库上表明,对于结合了基于注意力的编码器-解码器声学模型和语言模型的组合,其模型尺度的学习效果与人工调参一样有效。我们进一步将这种方法扩展到无法通过人工调参的子词相关模型尺度,这使得 LBS 上提升了 7%,SWB 上提升了 3%。我们还表明,尺度和模型参数的联合训练是可行的,并在 LBS 上带来了额外的 6% 的提升。

关键词

引用

@article{arxiv.2110.09324,
  title  = {Automatic Learning of Subword Dependent Model Scales},
  author = {Felix Meyer and Wilfried Michel and Mohammad Zeineldeen and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2110.09324},
  year   = {2021}
}

备注

submitted to ICASSP 2022