中文

用于含噪语音识别的不变表示

计算与语言 2016-12-07 v1 计算机视觉与模式识别 机器学习 声音 机器学习

摘要

现代自动语音识别(ASR)系统需要稳健地应对由环境、说话人、信道和录音条件引起的声学变异性。在现代基于神经网络的 ASR 系统中,确保这种对变异性的稳健性是一项挑战,尤其是当训练期间未观察到所有类型的变异性时。我们试图通过鼓励神经网络声学模型学习不变特征表示来解决这个问题。我们借鉴了近期利用生成对抗网络进行图像生成的研究思路,以及扩展基于对抗梯度训练的领域自适应思想。Ganin 等人近期的一项工作提出,通过使用主目标分类网络的中间表示,经由一个独立的神经网络来恶化域分类器的性能,从而将对抗训练用于图像领域自适应。我们的工作重点研究能够为 ASR 产生对噪声条件具有不变性的表示的神经网络架构。我们在噪声鲁棒 ASR 的流行基准 Aurora-4 任务上评估了所提出的架构。我们表明,我们的方法比标准多条件训练具有更好的泛化能力,尤其是在训练期间仅观察到少数噪声类别时。

关键词

引用

@article{arxiv.1612.01928,
  title  = {Invariant Representations for Noisy Speech Recognition},
  author = {Dmitriy Serdyuk and Kartik Audhkhasi and Philémon Brakel and Bhuvana Ramabhadran and Samuel Thomas and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1612.01928},
  year   = {2016}
}

备注

5 pages, 1 figure, 1 table, NIPS workshop on end-to-end speech recognition