BigVGAN:一种基于大规模训练的通用神经声码器
声音
2023-02-17 v2 计算与语言
机器学习
音频与语音处理
摘要
尽管近年来基于生成对抗网络(GAN)的声码器(即模型以声学特征为条件生成原始波形)取得了进展,但要为多种录音环境下的众多说话人合成高保真音频仍具挑战。本文提出 BigVGAN,一种无需微调即可很好地泛化到各种分布外场景的通用声码器。我们在 GAN 生成器中引入周期激活函数与抗混叠表示,为音频合成带来所需的归纳偏置并显著提升音频质量。此外,我们将 GAN 声码器的训练规模扩大到史无前例的至多 1.12 亿(112M)参数。我们识别并解决了大规模音频 GAN 训练中的失效模式,同时保持高保真输出且不过度正则化。我们的 BigVGAN 仅以干净语音(LibriTTS)训练,便在各种零样本(分布外)条件下取得最先进(state-of-the-art)性能,包括未见说话人、语言、录音环境、歌声、音乐与器乐音频。我们在 https://github.com/NVIDIA/BigVGAN 发布代码与模型。
引用
@article{arxiv.2206.04658,
title = {BigVGAN: A Universal Neural Vocoder with Large-Scale Training},
author = {Sang-gil Lee and Wei Ping and Boris Ginsburg and Bryan Catanzaro and Sungroh Yoon},
journal= {arXiv preprint arXiv:2206.04658},
year = {2023}
}
备注
To appear at ICLR 2023. Listen to audio samples from BigVGAN at: https://bigvgan-demo.github.io/