中文

端到端语音合成中用于风格控制与转换的隐表示学习

计算与语言 2019-02-15 v2 声音 音频与语音处理

摘要

本文在端到端语音合成模型中引入变分自编码器(Variational Autoencoder, VAE),以无监督方式学习说话风格的隐表示。通过 VAE 学习到的风格表示展现出解耦、缩放与组合等良好特性,从而便于进行风格控制。在该框架下,风格转换可通过先利用 VAE 的识别网络推断风格表示,再将其输入 TTS 网络以引导合成语音中的风格来实现。为避免训练中的 Kullback-Leibler(KL)散度坍缩,采用了若干技术。最终,所提模型在风格控制上表现良好,并在风格转换的 ABX 偏好测试中优于全局风格标记(Global Style Token, GST)模型。

关键词

引用

@article{arxiv.1812.04342,
  title  = {Learning latent representations for style control and transfer in end-to-end speech synthesis},
  author = {Ya-Jie Zhang and Shifeng Pan and Lei He and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:1812.04342},
  year   = {2019}
}

备注

Paper accepted by ICASSP 2019