中文

通过深度对抗训练提升声学模型的噪声鲁棒性

声音 2018-05-04 v1 机器学习 音频与语音处理

摘要

在真实环境中,语音通常会受到各种噪声与混响的干扰,这会使自动语音识别(ASR)系统的性能急剧下降。为缓解此问题,最常见的方法是使用精心设计的语音增强方法作为 ASR 的前端。然而,此类方法会额外消耗更复杂的流水线、更多的计算量甚至更高的硬件成本(麦克风阵列)。此外,语音增强会导致语音失真以及与训练的不匹配。本文提出一种对抗训练方法,直接提升声学模型的噪声鲁棒性。具体而言,在训练阶段采用生成对抗网络(GAN)与基于神经网络的声学模型(AM)的联合组合方案。GAN 用于在判别器的引导下从含噪特征生成干净的特征表示,该判别器试图区分真实干净信号与生成信号。生成器、判别器与 AM 的联合优化集中了 GAN 与 AM 在语音识别上的优势。在 CHiME-4 上的系统实验表明,所提方法显著提升了 AM 的噪声鲁棒性,并在开发集和测试集上分别实现了 23.38% 和 11.54% 的平均相对错误率降低。

关键词

引用

@article{arxiv.1805.01357,
  title  = {Boosting Noise Robustness of Acoustic Model via Deep Adversarial Training},
  author = {Bin Liu and Shuai Nie and Yaping Zhang and Dengfeng Ke and Shan Liang and Wenju Liu1},
  journal= {arXiv preprint arXiv:1805.01357},
  year   = {2018}
}