中文

VISinger:基于对抗学习的变分推断端到端歌唱语音合成

音频与语音处理 2022-02-25 v2 声音

摘要

本文中,我们提出 VISinger,一种完整的端到端高质量歌唱语音合成(SVS)系统,直接从歌词与乐谱生成音频波形。我们的方法受 VITS 启发,其采用基于 VAE 的后验编码器并结合基于归一化流的前验编码器与对抗解码器以实现完整的端到端语音生成。VISinger 遵循 VITS 的主体架构,但基于歌唱特性对前验编码器做了实质性改进。首先,我们不使用音素级声学特征均值与方差,而是引入长度调节器与帧先验网络以获取声学特征的帧级均值与方差,建模歌唱中丰富的声学变化。其次,我们进一步引入 F0 预测器以引导帧先验网络,带来更稳定的歌唱表现。最后,为改善歌唱节奏,我们修改时长预测器以专门预测音素到音符时长比,并借助歌唱音符归一化。在一个专业普通话歌唱语料库上的实验表明,VISinger 显著优于 FastSpeech+Neural-Vocoder 两阶段方法与 oracle VITS;消融研究证明了不同贡献的有效性。

关键词

引用

@article{arxiv.2110.08813,
  title  = {VISinger: Variational Inference with Adversarial Learning for End-to-End Singing Voice Synthesis},
  author = {Yongmao Zhang and Jian Cong and Heyang Xue and Lei Xie and Pengcheng Zhu and Mengxiao Bi},
  journal= {arXiv preprint arXiv:2110.08813},
  year   = {2022}
}

备注

5 pages, ICASSP 2022