基于参数化重合成的语音去噪
音频与语音处理
2019-04-03 v1 机器学习
声音
摘要
本工作提出将干净语音声码器参数作为执行语音增强的神经网络的目标。这些参数原本为文本转语音合成而设计,因此既能产生高质量重合成,又易于用神经网络建模,但此前尚未用于语音增强。与给定含噪语音真实转录的匹配文本转语音系统相比,我们的模型能生成更自然的语音,因为它可获取含噪语音中的真实韵律。与两种去噪系统( oracle Wiener 掩码与基于 DNN 的掩码预测器)相比,我们的模型在主观质量与可懂度上等同于 oracle Wiener 掩码,并优于实际系统。基于声码器的上界表明,该方法仍有超越 oracle Wiener 掩码的提升空间。我们以两名说话人测试说话人依赖性,表明单一模型可用于多名说话人。
引用
@article{arxiv.1904.01537,
title = {Speech denoising by parametric resynthesis},
author = {Soumi Maiti and Michael I Mandel},
journal= {arXiv preprint arXiv:1904.01537},
year = {2019}
}