基于克隆网络的生成式语音增强
音频与语音处理
2019-09-12 v1 声音
摘要
我们提出通过从含噪信号中提取的显著表示来再生干净语音,从而实现语音增强。提取显著特征的网络使用一组权重共享的提取器网络克隆体进行训练。这些克隆体以同一语音信号的不同含噪版本的梅尔频率谱作为输入。通过鼓励克隆体对这些不同输入信号的输出相似,我们训练出一个对噪声鲁棒的特征提取器网络。在推理时,显著特征构成 WaveNet 网络的输入,该网络生成与真实干净信号具有相同属性的自然且干净的语音信号。随着信号变得更嘈杂,我们的系统产生停留在语音流形上的自然听感错误,取代了其他系统中发现的传统伪影。我们的实验证实,根据类 MUSHRA 测试,我们的生成式增强系统在生成式增强器类别中提供了最先进的增强性能。基于克隆体的系统在每个输入信噪比(SNR)范围内都以统计显著性匹配或优于其他系统。
引用
@article{arxiv.1909.04776,
title = {Generative Speech Enhancement Based on Cloned Networks},
author = {Michael Chinen and W. Bastiaan Kleijn and Felicia S. C. Lim and Jan Skoglund},
journal= {arXiv preprint arXiv:1909.04776},
year = {2019}
}
备注
Accepted WASPAA 2019