中文

基于去噪扩散概率Wasserstein GAN的普通话歌声合成

音频与语音处理 2022-09-22 v1 声音 信号处理

摘要

歌声合成(SVS)是从给定乐谱计算机生成类人歌唱声音的技术。为有效且高效地实现端到端SVS,本工作采用为高质量语音与歌声合成所建立的声学模型-神经声码器架构。具体而言,本工作旨在通过结合扩散去噪概率模型(DDPM)与Wasserstein生成对抗网络(WGAN)构建声学模型主干,以在合成声音中追求更高水平的表现力。在所提声学模型之上,采用集成了微调的HiFi-GAN神经声码器,以确保所得端到端SVS系统的最佳合成质量。该端到端系统在多歌手Mpop600普通话歌声数据集上进行了评估。实验中,所提系统在音乐表现力与高频声学细节方面较先前标志性同类系统有所提升。此外,对抗声学模型稳定收敛,无需强制重构目标,表明所提DDPM与WGAN结合架构相较于基于GAN的SVS系统具有收敛稳定性。

关键词

引用

@article{arxiv.2209.10446,
  title  = {Mandarin Singing Voice Synthesis with Denoising Diffusion Probabilistic Wasserstein GAN},
  author = {Yin-Ping Cho and Yu Tsao and Hsin-Min Wang and Yi-Wen Liu},
  journal= {arXiv preprint arXiv:2209.10446},
  year   = {2022}
}