中文

探究基于生成对抗网络的语音去混响以实现鲁棒语音识别

声音 2019-01-01 v3 计算与语言 音频与语音处理

摘要

我们研究了生成对抗网络(GAN)在用于鲁棒语音识别的语音去混响中的应用。近期已有研究将 GAN 用于语音增强以去除加性噪声,但尚缺乏工作考察其在语音去混响中的能力,且使用 GAN 的优势尚未完全确立。在本文中,我们深入研究了在 ASR 中使用基于 GAN 的去混响前端。首先,我们研究了不同去混响网络(GAN 中的生成器)的有效性,并发现在我们的数据集中,与前馈 DNN 和 CNN 相比,LSTM 带来了显著的提升。其次,在深度 LSTM 中进一步添加残差连接也能提升性能。最后,我们发现,为了 GAN 的成功,在训练期间使用相同的 mini-batch 数据更新生成器和判别器非常重要。此外,如先前研究所建议的,将混响语谱图作为判别器的条件可能会降低性能。总而言之,在强大的多条件训练声学模型上进行测试时,与基线 DNN 去混响网络相比,我们基于 GAN 的去混响前端实现了 14%-19% 的相对 CER 下降。

关键词

引用

@article{arxiv.1803.10132,
  title  = {Investigating Generative Adversarial Networks based Speech Dereverberation for Robust Speech Recognition},
  author = {Ke Wang and Junbo Zhang and Sining Sun and Yujun Wang and Fei Xiang and Lei Xie},
  journal= {arXiv preprint arXiv:1803.10132},
  year   = {2019}
}

备注

Interspeech 2018