ESTVocoder:基于 Mel 频谱图的激发-谱-转换神经语音合成器
声音
2024-11-19 v1 音频与语音处理
摘要
本文提出了 ESTVocoder,这是一种基于源-滤波理论框架的新型激发-谱-转换神经语音合成器。ESTVocoder 将激发的�幅和相位谱转换为相应的语音�幅和相位谱,使用基于 ConvNeXt v2 块的神经滤波器。最后通过逆短时傅里叶变换 (ISTFT) 重构语音波形。激发基于 F0 构建:对于有声段,其包含完整的谐波信息;对于无声段,其由噪声表示。激发为滤波器提供了语音�幅和相位模式的先验知识,旨在减少与常规神经语音合成器相比的建模难度。为确保合成语音的保真度,应用了包含多尺度和多分辨率判别器的对抗训练策略。分析-合成和文本到语音实验均确认,我们提出的 ESTVocoder 在合成语音质量方面优于或相当于其他基准神经语音合成器,如 HiFi-GAN、SiFi-GAN 和 Vocos,同时具有合理的模型复杂度和生成速度。额外的分析实验还表明,引入的激发有效加快了模型收敛速度,归功于激发中包含的语音谱先验信息。
关键词
引用
@article{arxiv.2411.11258,
title = {ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram},
author = {Xiao-Hang Jiang and Hui-Peng Du and Yang Ai and Ye-Xin Lu and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2411.11258},
year = {2024}
}
备注
Accepted by NCMMSC2024