中文

基于信任正则化的循环神经网络语言建模知识蒸馏

计算与语言 2019-04-09 v1

摘要

循环神经网络(RNNs)因相对于传统基于 N-gram 的模型具有更优性能而主导了语言建模。在许多应用中,使用大型循环神经网络语言模型(RNNLM)或若干 RNNLM 的集成。这些模型占用大量内存且需要繁重计算。本文中,我们考察应用知识蒸馏在缩减 RNNLM 模型尺寸方面的效果。此外,我们提出一种信任正则化方法以改进 RNNLM 的知识蒸馏训练。利用带信任正则化的知识蒸馏,我们将参数规模缩减至先前发表最佳模型的三分之一,同时在 Penn Treebank 数据上保持最先进的困惑度结果。在语音识别 N-best 重打分任务中,我们将 RNNLM 模型尺寸缩减至基线系统的 18.5%,且在 Wall Street Journal 数据集上词错误率(WER)性能无退化。

关键词

引用

@article{arxiv.1904.04163,
  title  = {Knowledge Distillation For Recurrent Neural Network Language Modeling With Trust Regularization},
  author = {Yangyang Shi and Mei-Yuh Hwang and Xin Lei and Haoyu Sheng},
  journal= {arXiv preprint arXiv:1904.04163},
  year   = {2019}
}

备注

ICASSP 2019