中文

SingGAN:用于高保真歌声生成的生成对抗网络

音频与语音处理 2022-08-08 v4 多媒体 声音

摘要

深度生成模型在语音合成方面已取得显著进展,但高保真歌声合成因其长持续发音、丰富的高频成分和强烈的表现力,仍然是一个开放性问题。现有的为文本到语音设计的神经声码器不能直接应用于歌声合成,因为它们会导致毛刺和高频重建不佳。在这项工作中,我们提出了 SingGAN,一个专为高保真歌声合成设计的生成对抗网络。具体来说:1)为了缓解生成样本中的毛刺问题,我们提出了带有自适应特征学习滤波器的源激励,以扩展感受野模式并稳定长连续信号生成;2)SingGAN 引入了不同尺度的全局和局部判别器,以丰富低频细节并促进高频重建;3)为了提高训练效率,SingGAN 包含了辅助频谱损失和子带特征匹配惩罚损失。据我们所知,SingGAN 是首个面向高保真歌声声码化的工作。我们对 SingGAN 的评估展示了其最先进的结果,生成了更高质量(MOS 4.05)的样本。同时,SingGAN 在单个 NVIDIA 2080Ti GPU 上实现了比实时快 50 倍的采样速度。我们进一步证明,SingGAN 能很好地泛化到未见歌手的梅尔频谱反转任务,并且端到端的歌声合成系统 SingGAN-SVS 采用两阶段流水线将乐谱转换为富有表现力的歌声。音频样本可在 \url{https://SingGAN.github.io/} 获取。

关键词

引用

@article{arxiv.2110.07468,
  title  = {SingGAN: Generative Adversarial Network For High-Fidelity Singing Voice Generation},
  author = {Rongjie Huang and Chenye Cui and Feiyang Chen and Yi Ren and Jinglin Liu and Zhou Zhao and Baoxing Huai and Zhefeng Wang},
  journal= {arXiv preprint arXiv:2110.07468},
  year   = {2022}
}

备注

Accepted by ACM Multimedia 2022