中文

采用非侵入式PESQNet监督的深度噪声抑制以实现真实训练数据的使用

音频与语音处理 2021-04-01 v1

摘要

采用深度神经网络(DNN)的数据驱动语音增强即使在不平稳噪声存在时也能提供最先进的性能。在训练过程中,大多数语音增强神经网络以全监督方式训练,其损失需要由干净语音与加性噪声合成带噪语音。然而在实际部署中,仅有带噪语音混合可用,这就引出了一个问题:此类数据如何能在训练中被有利地利用。本工作中,我们提出一种端到端非侵入式PESQNet DNN,其估计语音质量感知评估(PESQ)分数,从而为真实数据提供无参考损失。作为另一创新,我们将PESQNet损失与去噪及去混响损失项结合,并以“弱”监督方式训练基于复掩码的全卷积循环神经网络(FCRN),每个训练周期使用部分合成数据、部分真实数据,再使用合成数据以保持PESQNet的时效性。在主观听音测试中,我们所提框架总体优于Interspeech 2021深度噪声抑制(DNS)挑战赛基线0.09个MOS分,尤其在背景噪声MOS分上高出0.45分。

关键词

引用

@article{arxiv.2103.17088,
  title  = {Deep Noise Suppression With Non-Intrusive PESQNet Supervision Enabling the Use of Real Training Data},
  author = {Ziyi Xu and Maximilian Strake and Tim Fingscheidt},
  journal= {arXiv preprint arXiv:2103.17088},
  year   = {2021}
}