中文

通过变分自编码器建模表达特征实现富有表现力的语音合成

计算与语言 2019-02-12 v3 声音 音频与语音处理

摘要

神经自回归模型近期的进展提升了语音合成(speech synthesis, SS)的性能。然而,由于它们缺乏对语音全局特征(如说话人个性或说话风格)建模的能力,尤其当这些特征未被标注时,使神经自回归 SS 系统更具表现力仍是一个开放问题。在本文中,我们提出将自回归 SS 模型 VoiceLoop 与变分自编码器(Variational Autoencoder, VAE)相结合。不同于传统自回归 SS 系统,该方法利用 VAE 显式建模全局特征,从而能以无监督方式控制合成语音的表现力。使用 VCTK 与 Blizzard2012 数据集的实验表明,VAE 有助于 VoiceLoop 生成更高质量的语音,并通过将全局特征纳入语音生成过程来控制其合成语音中的表达。

关键词

引用

@article{arxiv.1804.02135,
  title  = {Expressive Speech Synthesis via Modeling Expressions with Variational Autoencoder},
  author = {Kei Akuzawa and Yusuke Iwasawa and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:1804.02135},
  year   = {2019}
}

备注

Accepted by Interspeech 2018