NeuralDPS:基于多带激励的确定性加随机神经模型用于噪声可控波形生成
声音
2022-03-08 v1 计算与语言
音频与语音处理
摘要
传统声码器具有合成效率高、可解释性强和语音可编辑的优点,而神经声码器具有合成质量高的优势。为结合两类声码器的优点,受传统确定性加随机模型启发,本文提出一种名为NeuralDPS的新型神经声码器,其能保持高语音质量并获得高合成效率与噪声可控性。首先,该框架包含四个模块:确定性源模块、随机源模块、神经浊/清音(V/UV)决策模块和神经滤波模块。声码器所需输入仅为谱参数,避免了估计如F0等额外参数带来的误差。其次,为解决不同频带中确定性成分与随机成分比例可能不同这一问题,采用多带激励策略生成更精确的激励信号并减轻神经滤波器的负担。第三,提出一种控制语音噪声成分的方法,从而可轻松调节语音的信噪比(SNR)。客观与主观实验结果表明,我们提出的NeuralDPS声码器可获得与WaveNet相近的性能,且波形生成速度至少比WaveNet声码器快280倍,在单CPU核上也比WaveGAN的合成效率高28%。我们还通过实验验证该方法能有效控制预测语音中的噪声成分并调节语音SNR。生成语音示例见 https://hairuo55.github.io/NeuralDPS。
引用
@article{arxiv.2203.02678,
title = {NeuralDPS: Neural Deterministic Plus Stochastic Model with Multiband Excitation for Noise-Controllable Waveform Generation},
author = {Tao Wang and Ruibo Fu and Jiangyan Yi and Jianhua Tao and Zhengqi Wen},
journal= {arXiv preprint arXiv:2203.02678},
year = {2022}
}
备注
15 pages, 12 figures; Accepted to TASLP. Demo page https://hairuo55.github.io/NeuralDPS. arXiv admin note: text overlap with arXiv:1906.09573 by other authors