BigWavGAN:用于音乐超分辨率的波到波生成对抗网络
声音
2023-10-31 v2 音频与语音处理
摘要
一般而言,深度神经网络(DNN)在其模型规模较大时有望具备高性能。然而,在音乐超分辨率(SR)中,大型模型未能产生与其规模相称的高质量结果。我们将此归因于 DNN 无法从标准均方误差损失中学习到与其规模相称的信息。为释放大型 DNN 模型在音乐超分辨率中的潜力,我们提出 BigWavGAN,它将大规模波到波模型 Demucs 与最先进(SOTA)判别器及对抗训练策略相结合。我们的判别器由多尺度判别器(MSD)和多分辨率判别器(MRD)组成。在推理时,由于仅使用生成器,与基线模型 Demucs 相比无需额外的参数或计算资源。客观评估证实了 BigWavGAN 在音乐超分辨率中的有效性。主观评估表明,BigWavGAN 能生成感知质量显著优于基线模型的音乐。值得注意的是,BigWavGAN 在模拟和真实场景中都超越了 SOTA 音乐超分辨率模型。此外,BigWavGAN 展现出处理分布外数据的优越泛化能力。所进行的消融研究揭示了我们的判别器和训练策略的重要性。样本可在演示页面获取。
引用
@article{arxiv.2308.06483,
title = {BigWavGAN: A Wave-To-Wave Generative Adversarial Network for Music Super-Resolution},
author = {Yenan Zhang and Hiroshi Watanabe},
journal= {arXiv preprint arXiv:2308.06483},
year = {2023}
}
备注
Accepted by IEEE GCCE 2023