中文

一种用于 TTS 系统 VAE 声学空间的学习条件先验

音频与语音处理 2021-06-21 v1 机器学习 声音

摘要

许多因素会影响语音,从而产生给定句子的不同表达。生成模型,例如变分自编码器(VAE),捕捉这种可变性,并允许通过采样获得同一句子的多种表达。韵律可变性的程度在很大程度上取决于采样时所使用的先验。在本文中,我们提出一种新方法来计算神经文本到语音(TTS)系统的 VAE 潜空间的信息化先验。通过这样做,我们旨在以更大的韵律可变性进行采样,同时获得对潜空间结构的可控性。通过使用一个次级的 VAE 的后验分布作为先验,并将其以说话人向量为条件,我们可以从主 VAE 中采样,显式地考虑条件因素,并为每个条件(即说话人)产生来自潜空间特定区域的样本。一项正式的偏好测试表明,所提出的方法相对于标准条件 VAE 具有显著偏好。我们还提供了潜空间的可视化,其中出现了分离良好的条件特定簇,以及消融研究以更好地理解系统的行为。

关键词

引用

@article{arxiv.2106.10229,
  title  = {A learned conditional prior for the VAE acoustic space of a TTS system},
  author = {Penny Karanasou and Sri Karlapati and Alexis Moinet and Arnaud Joly and Ammar Abbas and Simon Slangen and Jaime Lorenzo Trueba and Thomas Drugman},
  journal= {arXiv preprint arXiv:2106.10229},
  year   = {2021}
}

备注

in Proceedings of Interspeech 2021