面向可控语音合成的层次化生成建模
计算与语言
2018-12-31 v2 机器学习
声音
音频与语音处理
摘要
本文提出一种神经序列到序列的文本到语音(TTS)模型,该模型能够控制生成语音中训练数据里极少标注的潜在属性,如说话风格、口音、背景噪声与录音条件。该模型被表述为基于变分自编码器(VAE)框架的条件生成模型,具有两级层次化潜变量。第一级为类别变量,表示属性组(如干净/含噪)并提供可解释性。第二级以第一级为条件,为多元高斯变量,刻画具体的属性配置(如噪声水平、语速)并实现对上述属性的解耦细粒度控制。这相当于对潜变量分布使用高斯混合模型(GMM)。大量评估证明了其控制上述属性的能力。特别地,我们在真实采集数据上训练了一个高质量可控TTS模型,该模型能够从含噪语音中推断说话人与风格属性,并用于合成具有可控说话风格的无噪语音。
引用
@article{arxiv.1810.07217,
title = {Hierarchical Generative Modeling for Controllable Speech Synthesis},
author = {Wei-Ning Hsu and Yu Zhang and Ron J. Weiss and Heiga Zen and Yonghui Wu and Yuxuan Wang and Yuan Cao and Ye Jia and Zhifeng Chen and Jonathan Shen and Patrick Nguyen and Ruoming Pang},
journal= {arXiv preprint arXiv:1810.07217},
year = {2018}
}
备注
27 pages, accepted to ICLR 2019