基于幅度与相位预测从含噪 Mel 频谱图生成纯净波形的神经去噪声码器
音频与语音处理
2024-11-20 v1 信号处理
摘要
本文提出了一种新型神经去噪声码器,能够从含噪 Mel 频谱图生成纯净语音波形。所提出的神经去噪声码器由两个组件组成,即频谱预测器和增强模块。频谱预测器首先从输入的含噪 Mel 频谱图预测含噪幅度谱和相位谱,随后增强模块从含噪频谱中恢复纯净幅度谱和相位谱。最后,通过逆短时傅里叶变换(iSTFT)重构纯净语音波形。所有操作均在帧级频谱域执行,分别以 APNet 声码器和 MP-SENet 语音增强模型作为这两个组件的骨干网络。实验结果表明,与现有的神经声码器相比,我们提出的神经去噪声码器在 VoiceBank+DEMAND 数据集上取得了最先进的性能。此外,尽管输入 Mel 频谱图中缺乏相位信息和部分幅度信息,所提出的神经去噪声码器仍取得了与几种先进语音增强方法相当的性能。
引用
@article{arxiv.2411.12268,
title = {A Neural Denoising Vocoder for Clean Waveform Generation from Noisy Mel-Spectrogram based on Amplitude and Phase Predictions},
author = {Hui-Peng Du and Ye-Xin Lu and Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2411.12268},
year = {2024}
}
备注
Accepted by NCMMSC2024