中文

基于音素后验图与对抗训练的多种到多种歌声转换

声音 2020-12-04 v1 人工智能 多媒体 音频与语音处理

摘要

本文描述了一种端到端对抗歌声转换(EA-SVC)方法。它可以通过给定的代表内容的音素后验图(PPG)、代表音高的F0以及分别代表音色的说话人嵌入,直接生成任意歌声波形。所提出的系统由三个模块组成:生成器GG、音频生成判别器DAD_{A}和特征解耦判别器DFD_F。生成器GG并行编码特征并将其逆变换为目标波形。为了使音色转换更加稳定可控,说话人嵌入进一步分解为一组代表不同音色簇的可训练向量的加权和。此外,为了实现更鲁棒和准确的歌声转换,提出解耦判别器DFD_F以去除编码PPG中残留的音高和音色相关信息。最后,进行两阶段训练以保持稳定有效的对抗训练过程。主观评价结果证明了我们所提方法的有效性。所提系统在歌声质量和歌手相似度方面均优于传统的级联方法和基于WaveNet的端到端方法。进一步的客观分析表明,采用所提两阶段训练策略训练的模型能够产生更平滑和更尖锐的共振峰,从而带来更高的音频质量。

关键词

引用

@article{arxiv.2012.01837,
  title  = {Phonetic Posteriorgrams based Many-to-Many Singing Voice Conversion via Adversarial Training},
  author = {Haohan Guo and Heng Lu and Na Hu and Chunlei Zhang and Shan Yang and Lei Xie and Dan Su and Dong Yu},
  journal= {arXiv preprint arXiv:2012.01837},
  year   = {2020}
}