中文

用于鲁棒语音识别的极深卷积神经网络

计算与语言 2016-10-04 v1

摘要

本文描述了我们之前关于极深卷积神经网络(CNNs)在 Aurora 4 任务中有效识别噪声语音的工作的扩展和优化。适当数量的卷积层、滤波器尺寸、池化操作和输入特征图都进行了修改:减小滤波器和池化尺寸,并扩展输入特征图的维度以允许添加更多卷积层。此外,开发了适当的输入填充和输入特征图选择策略。另外,开发了使用极深 CNN 与辅助特征 i-vector 和 fMLLR 特征联合训练的适配框架。这些修改相比作为基线的标准 CNN 给出了显著的词错误率降低。最后,将极深 CNN 与 LSTM-RNN 声学模型结合,并表明在联合声学模型解码方案中的状态级加权对数似然分数组合是非常有效的。在 Aurora 4 任务上,极深 CNN 实现了 8.81% 的 WER,通过辅助特征联合训练进一步降至 7.99%,通过 LSTM-RNN 联合解码降至 7.09%。

关键词

引用

@article{arxiv.1610.00277,
  title  = {Very Deep Convolutional Neural Networks for Robust Speech Recognition},
  author = {Yanmin Qian and Philip C Woodland},
  journal= {arXiv preprint arXiv:1610.00277},
  year   = {2016}
}

备注

accepted by SLT 2016