中文

基于 Mel 频谱图的神经语音合成器是否必须使用 GAN?

音频与语音处理 2025-08-12 v1

摘要

最近,主流基于 Mel 频谱图的神经语音合成器依赖生成对抗网络(GAN)实现高保真语音生成,例如 HiFi-GAN 和 BigVGAN。然而,GAN 的使用限制了训练效率和模型复杂度。因此,本文提出一种新颖的 FreeGAN 语音合成器,以回答基于 Mel 频谱图的神经语音合成器是否必须使用 GAN这一问题。FreeGAN 采用幅度-相位串行预测框架,无需进行 GAN 训练。它引入幅度先验输入、SNAKE-ConvNeXt v2 主干网络以及频率加权反包裹相位损失,以弥补因缺乏 GAN 而产生的性能损失。实验结果表明,FreeGAN 的语音质量与先进的 GAN-based 合成器相当,同时显著提高了训练效率和模型复杂度。其他基于显式相位预测的神经语音合成器也可以利用我们提出的方法在没有 GAN 的情况下工作。

关键词

引用

@article{arxiv.2508.07711,
  title  = {Is GAN Necessary for Mel-Spectrogram-based Neural Vocoder?},
  author = {Hui-Peng Du and Yang Ai and Rui-Chen Zheng and Ye-Xin Lu and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2508.07711},
  year   = {2025}
}

备注

Accepted by IEEE Signal Processing Letters