SnakeGAN:利用DDSP先验知识与周期性归纳偏置的通用声码器
音频与语音处理
2023-09-15 v1 声音
摘要
基于生成对抗网络(GAN)的神经声码器因其高生成质量、高效推理和小计算开销而被广泛应用于音频合成任务。然而,训练一个能很好泛化到域外(OOD)场景(如未见说话风格、非语音发声、歌唱和音乐片段)的通用声码器仍具挑战性。本工作中,我们提出SnakeGAN,一种基于GAN的通用声码器,可在各种OOD场景中合成高保真音频。SnakeGAN以可微分数字信号处理(DDSP)模型生成的粗粒度信号作为先验知识,旨在从梅尔频谱恢复高保真波形。我们通过Snake激活函数与抗混叠表示将周期性非线性引入生成器,进一步为音频合成带来所需的归纳偏置,并显著提升通用声码器在未见场景中的外推能力。为验证所提方法的有效性,我们仅使用语音数据训练SnakeGAN,并以主客观指标评估其在多种OOD分布下的性能。实验结果表明,SnakeGAN显著优于对比方法,能生成包含未见风格未见说话人、歌唱声、器乐片段和非语言发声的高保真音频样本。
引用
@article{arxiv.2309.07803,
title = {SnakeGAN: A Universal Vocoder Leveraging DDSP Prior Knowledge and Periodic Inductive Bias},
author = {Sipan Li and Songxiang Liu and Luwen Zhang and Xiang Li and Yanyao Bian and Chao Weng and Zhiyong Wu and Helen Meng},
journal= {arXiv preprint arXiv:2309.07803},
year = {2023}
}
备注
Accepted by ICME 2023