中文

用于鲁棒语音识别的带有模仿损失的频谱特征映射

声音 2018-03-28 v1 计算与语言 音频与语音处理

摘要

对于语音增强任务,局部学习目标对有助于语音识别的语音结构是不敏感的。我们建议添加一个全局准则,以确保去噪语音对 ASR 等下游任务是有用的。我们首先在干净语音上训练一个频谱分类器来预测 senone 标签。然后,将该频谱分类器与我们的语音增强器结合,作为一个含噪语音识别器。该模型被教导去模仿频谱分类器单独在干净语音上的输出。这种模仿损失与传统局部准则相结合,训练语音增强器以产生去噪语音。将去噪语音输入到现成的 Kaldi 训练方案中处理 CHiME-2 语料库,在 WER 上显示出显著改善。

关键词

引用

@article{arxiv.1803.09816,
  title  = {Spectral feature mapping with mimic loss for robust speech recognition},
  author = {Deblin Bagchi and Peter Plantinga and Adam Stiff and Eric Fosler-Lussier},
  journal= {arXiv preprint arXiv:1803.09816},
  year   = {2018}
}