中文

基于神经声码器的参数化重合成

声音 2019-11-15 v2 机器学习 音频与语音处理

摘要

噪声抑制系统通常产生质量受损的输出语音。我们提议利用神经声码器的高质量语音生成能力来进行噪声抑制。我们使用神经网络从含噪语音预测干净的梅尔谱图特征,然后比较两种神经声码器 WaveNet 和 WaveGlow,用于从预测的梅尔谱图合成干净语音。WaveNet 和 WaveGlow 均取得比源分离模型 Chimera++ 更好的主客观质量分数。此外,WaveNet 和 WaveGlow 的主观质量评分也显著优于 oracle Wiener 掩码。而且,我们观察到在 WaveNet 和 WaveGlow 之间,WaveNet 取得最佳的主观质量分数,尽管代价是波形生成慢得多。

关键词

引用

@article{arxiv.1906.06762,
  title  = {Parametric Resynthesis with neural vocoders},
  author = {Soumi Maiti and Michael I Mandel},
  journal= {arXiv preprint arXiv:1906.06762},
  year   = {2019}
}