神经声码器的说话人无关性及其在参数重合成语音增强中的影响
声音
2019-11-15 v1 机器学习
音频与语音处理
摘要
传统语音增强系统产生的语音质量受损。在此我们提议利用神经声码器的高质量语音生成能力来实现更高质量的语音增强。我们称之为参数重合成(PR)。在先前工作中,我们展示了 PR 系统使用两个神经声码器 WaveNet 和 WaveGlow 为单一说话人生成高质量语音。这两个声码器传统上都是说话人相关的。在此我们首先展示当在足够多说话人的数据上训练时,这些声码器能从未见过的男女说话人生成与训练中所见说话人质量相似的语音。接下来使用这两个声码器以及新声码器 LPCNet,我们在未见说话人上评估 PR 的降噪质量,并展示其客观信号与整体质量高于最先进语音增强系统 Wave-U-Net、Wavenet-denoise 和 SEGAN。此外,在主观质量上,多说话人 PR 优于 oracle Wiener 掩码。
引用
@article{arxiv.1911.06266,
title = {Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement},
author = {Soumi Maiti and Michael I Mandel},
journal= {arXiv preprint arXiv:1911.06266},
year = {2019}
}