中文

利用蒙特卡洛 dropout 进行语音中的非平稳噪声抑制

音频与语音处理 2018-08-29 v1 声音

摘要

在本工作中,我们提出将 dropout 用作贝叶斯估计器,以提升深度神经网络(DNN)用于语音增强的泛化能力。通过使用蒙特卡洛(MC)dropout,我们表明该 DNN 在未见噪声与 SNR 条件下实现了更好的增强。DNN 在由 Factory2、M109、Babble、Leopard 与 Volvo 噪声以 0、5 和 10 dB SNR 污染的语音上训练。语音样本取自 TIMIT 数据库,噪声取自 NOISEX-92。在另一实验中,我们分别以 Factory2、M109、Babble、Leopard 与 Volvo 噪声在 0、5 和 10 dB SNR 下污染的语音训练五个 DNN 模型。模型精度(用 MC dropout 估计)被用作平方误差的代理,以依据各模型在测试数据每帧上的表现动态选取最佳 DNN 模型。我们提出一种带模型精度阈值的算法,在基于分类器的模型选择方案与基于模型精度的选择方案间切换。测试在由未见噪声 White、Pink 与 Factory1 及全部五种已见噪声污染的语音上进行。

关键词

引用

@article{arxiv.1808.09432,
  title  = {Using Monte Carlo dropout for non-stationary noise reduction from speech},
  author = {Nazreen P. M. and A. G. Ramakrishnan},
  journal= {arXiv preprint arXiv:1808.09432},
  year   = {2018}
}

备注

This article draws from our previous work arXiv:1806.00516