中文

WGANSing:基于 Wasserstein-GAN 的多声部歌唱语音合成器

声音 2020-02-13 v3 音频与语音处理

摘要

我们提出了一种基于深度神经网络的歌唱语音合成器,其受深度卷积生成对抗网络(DCGAN)架构启发,并使用 Wasserstein-GAN 算法进行优化。我们采用声码器参数进行声学建模,以分离音高与音色的影响。这有助于对歌唱语音中音大的大范围变化进行建模。我们的网络以连续帧级语言特征和基频特征块,以及全局歌手身份作为输入,输出对应于该特征块的声码器特征。这种块式方法连同训练方法使我们能够对输入块内特征的时间依赖关系进行建模。在推理时,使用重叠相加(overlap-add)程序将顺序块拼接。我们表明,根据客观指标和主观听测,我们模型的性能相对于最先进水平(state-of-the-art)和原始样本具有竞争力。我们还在补充网站上展示了合成示例,并通过 GitHub 提供源代码。

关键词

引用

@article{arxiv.1903.10729,
  title  = {WGANSing: A Multi-Voice Singing Voice Synthesizer Based on the Wasserstein-GAN},
  author = {Pritish Chandna and Merlijn Blaauw and Jordi Bonada and Emilia Gomez},
  journal= {arXiv preprint arXiv:1903.10729},
  year   = {2020}
}