中文

MDNet:从深度先验梯度学习单通道语音增强

声音 2022-03-17 v2 音频与语音处理

摘要

传统基于统计信号处理模型的方法可依赖特定统计假设推导最优估计器,而当前基于学习的方法通过深度神经网络进一步提升了性能上限,却以高封装性和缺乏充分可解释性为代价。立于传统基于模型的方法与基于学习的方法之交叉点,我们提出一种基于最大后验(MAP)框架的模型驱动方法,称为 MDNet,用于单通道语音增强。具体而言,原问题被表述为关于语音与噪声分量的联合后验估计。不同于对先验项的人工假设,我们提出通过网络对先验分布建模,从而可从训练数据中学习。该框架采用展开结构,在每一步中,目标参数可通过显式梯度下降操作逐步估计。此外,另一网络作为融合模块进一步精炼先前的语音估计。实验在 WSJ0-SI84 与 Interspeech2020 DNS-Challenge 数据集上进行,定量结果表明所提方法优于先前最先进的基线。

关键词

引用

@article{arxiv.2203.07179,
  title  = {MDNet: Learning Monaural Speech Enhancement from Deep Prior Gradient},
  author = {Andong Li and Chengshi Zheng and Ziyang Zhang and Xiaodong Li},
  journal= {arXiv preprint arXiv:2203.07179},
  year   = {2022}
}

备注

Submitted to Interspeech2022