中文

BigVSAN:利用切片对抗网络增强基于 GAN 的神经声码器

声音 2024-03-26 v2 机器学习 音频与语音处理

摘要

基于生成对抗网络(GAN)的声码器已被深入研究,因为它们能以快于实时的速度合成高保真音频波形。然而,已有报道指出大多数 GAN 无法获得在特征空间中判别真实与生成数据的最优投影。文献中已证明切片对抗网络(SAN)——一种可找到最优投影的改进 GAN 训练框架——在图像生成任务中有效。本文中,我们探究 SAN 在声码器任务中的有效性。为此,我们提出一种修改最小二乘 GAN(多数基于 GAN 的声码器所采用)的方案,使其损失函数满足 SAN 的要求。通过实验,我们证明 SAN 能以微小修改提升基于 GAN 的声码器(包括 BigVGAN)的性能。我们的代码见 https://github.com/sony/bigvsan。

关键词

引用

@article{arxiv.2309.02836,
  title  = {BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Network},
  author = {Takashi Shibuya and Yuhta Takida and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2309.02836},
  year   = {2024}
}

备注

Accepted at ICASSP 2024. Equation (5) in the previous version is wrong. We modified it