中文

用于可控语音合成无监督学习的深度编码器-解码器模型

音频与语音处理 2018-09-11 v3 机器学习 声音 机器学习

摘要

生成多样且恰当的合成语音需要对输出表达方式独立于所读文本进行控制。重要的非文本语音变化很少被标注,在这种情况下必须以无监督方式学习输出控制。本文中,我们对统计语音合成中无监督学习控制的方法进行了深入研究。例如,我们表明流行的无监督训练启发式方法可解释为某些自编码器模型中的变分推断。我们还将这类模型与 VQ-VAE(另一类近期提出的深度变分自编码器)相联系,并展示其可由非常相似的数学论证导出。我们讨论了这些新概率解释的含义。我们以情感语音合成的声学建模应用来说明各种方法的效用,其中用于学习表达控制的无监督方法(无需情感标签)在许多方面达到或超越了先前最佳的有监督方法。

关键词

引用

@article{arxiv.1807.11470,
  title  = {Deep Encoder-Decoder Models for Unsupervised Learning of Controllable Speech Synthesis},
  author = {Gustav Eje Henter and Jaime Lorenzo-Trueba and Xin Wang and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:1807.11470},
  year   = {2018}
}

备注

17 pages, 4 figures