利用蒙特卡洛 dropout 进行语音中的非平稳噪声抑制
音频与语音处理
2018-08-29 v1 声音
摘要
在本工作中,我们提出将 dropout 用作贝叶斯估计器,以提升深度神经网络(DNN)用于语音增强的泛化能力。通过使用蒙特卡洛(MC)dropout,我们表明该 DNN 在未见噪声与 SNR 条件下实现了更好的增强。DNN 在由 Factory2、M109、Babble、Leopard 与 Volvo 噪声以 0、5 和 10 dB SNR 污染的语音上训练。语音样本取自 TIMIT 数据库,噪声取自 NOISEX-92。在另一实验中,我们分别以 Factory2、M109、Babble、Leopard 与 Volvo 噪声在 0、5 和 10 dB SNR 下污染的语音训练五个 DNN 模型。模型精度(用 MC dropout 估计)被用作平方误差的代理,以依据各模型在测试数据每帧上的表现动态选取最佳 DNN 模型。我们提出一种带模型精度阈值的算法,在基于分类器的模型选择方案与基于模型精度的选择方案间切换。测试在由未见噪声 White、Pink 与 Factory1 及全部五种已见噪声污染的语音上进行。
引用
@article{arxiv.1808.09432,
title = {Using Monte Carlo dropout for non-stationary noise reduction from speech},
author = {Nazreen P. M. and A. G. Ramakrishnan},
journal= {arXiv preprint arXiv:1808.09432},
year = {2018}
}
备注
This article draws from our previous work arXiv:1806.00516