中文

WeSinger 2:基于多歌手条件对抗训练的全并行歌声合成

声音 2023-02-17 v8 音频与语音处理

摘要

本文旨在引入一个鲁棒的歌声合成(SVS)系统,通过利用对抗训练策略高效生成非常自然且逼真的歌声。一方面,我们设计了简单但通用的随机区域条件判别器来辅助监督声学模型,可有效避免频谱图预测的过平滑并提升 SVS 的表现力。另一方面,我们巧妙地将频谱图与帧级线性插值 F0 序列组合作为神经声码器的输入,并在波形域借助多个对抗条件判别器、在频域借助多尺度距离函数对其进行优化。实验结果与消融研究得出结论:相较于我们以往的自回归工作,新系统可通过微调覆盖几分钟到数小时的不同歌唱数据集高效产出高质量歌声。大量不同音色的合成歌曲已发布于 https://zzw922cn.github.io/wesinger2,强烈建议读者试听。

关键词

引用

@article{arxiv.2207.01886,
  title  = {WeSinger 2: Fully Parallel Singing Voice Synthesis via Multi-Singer Conditional Adversarial Training},
  author = {Zewang Zhang and Yibin Zheng and Xinhui Li and Li Lu},
  journal= {arXiv preprint arXiv:2207.01886},
  year   = {2023}
}

备注

accepted at ICASSP 2023