中文

ClariNet:端到端文本到语音中的并行波形生成

计算与语言 2019-02-25 v3 人工智能 机器学习 声音 音频与语音处理

摘要

在这项工作中,我们提出了一种基于 WaveNet 的并行波形生成新方案。与并行 WaveNet(van den Oord 等,2018)不同,我们通过最小化其高度峰值化输出分布之间的正则化 KL 散度,从自回归 WaveNet 中蒸馏出一个高斯逆自回归流。我们的方法以闭式计算 KL 散度,简化了训练算法并提供了非常高效的蒸馏。此外,我们引入了首个用于语音合成的文本到波形神经架构,其全卷积特性使得能够从零开始进行快速的端到端训练。它显著优于先前将文本到频谱图模型与单独训练的 WaveNet 相连的流水线(Ping 等,2018)。我们还成功在该端到端模型中基于隐藏表示蒸馏出了一个条件并行波形合成器。

关键词

引用

@article{arxiv.1807.07281,
  title  = {ClariNet: Parallel Wave Generation in End-to-End Text-to-Speech},
  author = {Wei Ping and Kainan Peng and Jitong Chen},
  journal= {arXiv preprint arXiv:1807.07281},
  year   = {2019}
}

备注

Published at ICLR 2019. (v3: add important details & discussion in Appendix A)