中文

用于语音识别中自适应神经声学建模的动态层归一化

计算与语言 2017-07-20 v1 机器学习

摘要

层归一化是近年来引入的一种用于归一化深度神经网络中神经元活动以改善训练速度和稳定性的技术。在本文中,我们介绍了一种称为动态层归一化(DLN)的新层归一化技术,用于语音识别中的自适应神经声学建模。通过动态生成层归一化中的缩放和偏移参数,DLN使神经声学模型适应由说话人、信道噪声和环境等各种因素引起的声学变化。与其他自适应声学模型不同,我们提出的方法不需要额外的自适应数据或说话人信息(如i-vector)。此外,由于动态生成自适应参数,模型大小保持固定。我们将提出的DLN应用于深度双向LSTM声学模型,并在两个用于大词汇量ASR实验的基准数据集上评估它们:WSJ和TED-LIUM release 2。实验结果表明,我们的DLN通过动态适应不同说话人和环境,在转写准确率方面改进了神经声学模型。

关键词

引用

@article{arxiv.1707.06065,
  title  = {Dynamic Layer Normalization for Adaptive Neural Acoustic Modeling in Speech Recognition},
  author = {Taesup Kim and Inchul Song and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1707.06065},
  year   = {2017}
}

备注

INTERSPEECH 2017