中文

一种用于鲁棒自动语音识别的去除噪声与混响的改进 DNN 频谱特征映射

音频与语音处理 2018-04-05 v2 声音

摘要

混响与加性噪声对自动语音识别系统的性能有不利影响。本文探讨了基于 DNN 的频谱特征映射去除混响与加性噪声影响的能力。在 CHiME-2 数据库上的实验表明,与基线系统相比,在 SNR 为 -6 dB、-3 dB、0 dB 和 3 dB 时,该 DNN 可实现 4.5% 的平均 WER 降低,而在 SNR 较高的 6 dB 和 9 dB 时仅为 0.8%。这些结果表明,该 DNN 在去除加性噪声方面比去除混响更有效。为提升 DNN 的性能,我们将其与表现出互补行为的加权预测误差(WPE)方法相结合。尽管该组合与基线相比实现了约 11% 的 WER 降低,但观察到的改进不如单独使用 WPE 获得的改进大。然而,我们对 DNN 的训练过程进行了修改,与基线系统相比实现了 18.3% 的平均 WER 降低。此外,改进后的 DNN 与 WPE 结合,与单独使用 WPE 相比实现了 7.9% 的 WER 降低。

关键词

引用

@article{arxiv.1803.09016,
  title  = {An improved DNN-based spectral feature mapping that removes noise and reverberation for robust automatic speech recognition},
  author = {Juan Pablo Escudero and José Novoa and Rodrigo Mahu and Jorge Wuth and Fernando Huenupán and Richard Stern and Néstor Becerra Yoma},
  journal= {arXiv preprint arXiv:1803.09016},
  year   = {2018}
}

备注

5 pages