中文

SpecDiff-GAN: 用于语音与音乐合成的频谱成形噪声扩散 GAN

声音 2024-02-06 v1 机器学习 音频与语音处理 信号处理

摘要

生成对抗网络(GAN)模型能够合成高质量的音频信号,同时确保快速的样本生成。然而,它们难以训练且容易出现模式崩溃和发散等问题。在本文中,我们引入了 SpecDiff-GAN,这是一种基于 HiFi-GAN 的神经声码器,最初是为从梅尔频谱图进行语音合成而设计的。在我们的模型中,通过前向扩散过程增强了训练稳定性,该过程包括在将真实和虚假样本输入判别器之前,向其注入来自高斯分布的噪声。我们进一步利用频谱成形的噪声分布来改进模型,旨在使判别器的任务更具挑战性。随后,我们展示了所提模型在多个数据集上用于语音和音乐合成的优点。我们的实验证实,与几个基线相比,我们的模型在音频质量和效率方面表现更优。

关键词

引用

@article{arxiv.2402.01753,
  title  = {SpecDiff-GAN: A Spectrally-Shaped Noise Diffusion GAN for Speech and Music Synthesis},
  author = {Teysir Baoueb and Haocheng Liu and Mathieu Fontaine and Jonathan Le Roux and Gael Richard},
  journal= {arXiv preprint arXiv:2402.01753},
  year   = {2024}
}

备注

Accepted at ICASSP 2024