中文

利用深度核与频率相关 Grid-RNN 改进 TDNNs

计算与语言 2018-02-21 v2 人工智能 声音 音频与语音处理 机器学习

摘要

时延神经网络 (TDNNs) 是大词汇量语音识别的有效声学模型。该模型的优势可归因于其有效建模长时域上下文的能力。然而,当前的 TDNN 模型相对较浅,限制了建模能力。本文提出一种通过加深 TDNN 时域卷积中所用核来增加网络深度的方法。性能最佳的核由三个全连接层组成,并具有从第一层输出到第三层输出的残差 (ResNet) 连接。我们研究了以卷积神经网络 (CNN) 与新设计的 Grid-RNN 形式将谱—时域处理作为 TDNN 输入。若对不同频带使用不同参数集,Grid-RNN 显著优于 CNN,并可通过使用双向 Grid-RNN 进一步增强。使用多类型广播 (MGB3) 英文数据 (275h) 的实验表明,深度核 TDNNs 将词错误率 (WER) 相对降低 6%,而与频率相关 Grid-RNN 结合时给出 9% 的相对 WER 降低。

关键词

引用

@article{arxiv.1802.06412,
  title  = {Improved TDNNs using Deep Kernels and Frequency Dependent Grid-RNNs},
  author = {Florian Kreyssig and Chao Zhang and Philip Woodland},
  journal= {arXiv preprint arXiv:1802.06412},
  year   = {2018}
}

备注

5 pages, 3 figures, 2 tables, to appear in 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2018)