基于神经声码器的参数化重合成
声音
2019-11-15 v2 机器学习
音频与语音处理
摘要
噪声抑制系统通常产生质量受损的输出语音。我们提议利用神经声码器的高质量语音生成能力来进行噪声抑制。我们使用神经网络从含噪语音预测干净的梅尔谱图特征,然后比较两种神经声码器 WaveNet 和 WaveGlow,用于从预测的梅尔谱图合成干净语音。WaveNet 和 WaveGlow 均取得比源分离模型 Chimera++ 更好的主客观质量分数。此外,WaveNet 和 WaveGlow 的主观质量评分也显著优于 oracle Wiener 掩码。而且,我们观察到在 WaveNet 和 WaveGlow 之间,WaveNet 取得最佳的主观质量分数,尽管代价是波形生成慢得多。
引用
@article{arxiv.1906.06762,
title = {Parametric Resynthesis with neural vocoders},
author = {Soumi Maiti and Michael I Mandel},
journal= {arXiv preprint arXiv:1906.06762},
year = {2019}
}