中文

SnakeGAN:利用DDSP先验知识与周期性归纳偏置的通用声码器

音频与语音处理 2023-09-15 v1 声音

摘要

基于生成对抗网络(GAN)的神经声码器因其高生成质量、高效推理和小计算开销而被广泛应用于音频合成任务。然而,训练一个能很好泛化到域外(OOD)场景(如未见说话风格、非语音发声、歌唱和音乐片段)的通用声码器仍具挑战性。本工作中,我们提出SnakeGAN,一种基于GAN的通用声码器,可在各种OOD场景中合成高保真音频。SnakeGAN以可微分数字信号处理(DDSP)模型生成的粗粒度信号作为先验知识,旨在从梅尔频谱恢复高保真波形。我们通过Snake激活函数与抗混叠表示将周期性非线性引入生成器,进一步为音频合成带来所需的归纳偏置,并显著提升通用声码器在未见场景中的外推能力。为验证所提方法的有效性,我们仅使用语音数据训练SnakeGAN,并以主客观指标评估其在多种OOD分布下的性能。实验结果表明,SnakeGAN显著优于对比方法,能生成包含未见风格未见说话人、歌唱声、器乐片段和非语言发声的高保真音频样本。

关键词

引用

@article{arxiv.2309.07803,
  title  = {SnakeGAN: A Universal Vocoder Leveraging DDSP Prior Knowledge and Periodic Inductive Bias},
  author = {Sipan Li and Songxiang Liu and Luwen Zhang and Xiang Li and Yanyao Bian and Chao Weng and Zhiyong Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2309.07803},
  year   = {2023}
}

备注

Accepted by ICME 2023