中文

Glow-WaveGAN 2:高质量零样本文本到语音合成与任意到任意语音转换

声音 2022-07-06 v1 音频与语音处理

摘要

语音生成的零样本场景旨在仅利用目标说话人的一条语音来合成未见过的全新声音。尽管零样本场景中适配新声音的挑战在声学建模与声码器两个阶段均存在,以往工作通常仅从单一阶段考虑该问题。本文我们将先前的Glow-WaveGAN扩展为Glow-WaveGAN 2,旨在从两个阶段同时解决问题,以实现高质量零样本文本到语音(TTS)与任意到任意语音转换(VC)。我们首先构建通用WaveGAN模型以提取语音的潜分布p(z)p(z)并从中重建波形。随后,基于流的声学模型只需从文本学习相同的p(z)p(z),这自然避免了声学模型与声码器之间的不匹配,从而在无需模型微调的情况下生成高质量语音。基于连续说话人空间与流的可逆性质,可获取任意说话人的条件分布,从而进一步对新说话人实现高质量零样本语音生成。我们特别研究了两种构建说话人空间的方法,即预训练说话人编码器与联合训练说话人编码器。Glow-WaveGAN 2的优越性已通过基于LibriTTS语料库与VTCK语料库的TTS和VC实验得到证明。

关键词

引用

@article{arxiv.2207.01832,
  title  = {Glow-WaveGAN 2: High-quality Zero-shot Text-to-speech Synthesis and Any-to-any Voice Conversion},
  author = {Yi Lei and Shan Yang and Jian Cong and Lei Xie and Dan Su},
  journal= {arXiv preprint arXiv:2207.01832},
  year   = {2022}
}