中文

基于识别模型的感知损失用于单通道语音增强与鲁棒 ASR

声音 2021-12-14 v1 音频与语音处理

摘要

单通道语音增强方法在噪声存在时并不总能提高自动识别率,因为它们可能引入对识别无益的失真。遵循序列神经网络模型端到端训练的趋势,若干研究组已通过前端增强模块与后端识别模块的联合训练来解决此问题。虽然该方法确保增强输出有助于识别,但增强模型可能过拟合训练数据,从而在未见噪声下削弱识别模型。为此,我们使用预训练的声学模型生成感知损失,使语音增强更能感知信号的语音属性。该方法保留了联合训练的一些益处,同时缓解了过拟合问题。在 Voicebank + DEMAND 数据集上的增强实验表明,该方法在某些客观增强指标上达到了新的 SOTA。结合与失真无关的训练,我们的方法在测试集上获得 2.80\% 的 WER,其识别性能相对联合训练提升超过 20\%,相对与失真无关的掩码训练提升 14\%。

关键词

引用

@article{arxiv.2112.06068,
  title  = {Perceptual Loss with Recognition Model for Single-Channel Enhancement and Robust ASR},
  author = {Peter Plantinga and Deblin Bagchi and Eric Fosler-Lussier},
  journal= {arXiv preprint arXiv:2112.06068},
  year   = {2021}
}