中文

多任务 WaveNet:一种无需基频条件的统计参数语音合成多任务生成模型

音频与语音处理 2018-06-25 v1 声音 信号处理

摘要

本文介绍了一种基于 WaveNet 在多任务学习框架下用于统计参数语音合成 (SPSS) 的改进生成模型。与原始 WaveNet 模型不同,所提出的多任务 WaveNet 将帧级声学特征预测作为辅助任务,并可移除原始 WaveNet 所需的外部基频预测模型。因此,改进后的 WaveNet 仅以语言特征为条件即可生成高质量语音波形。多任务 WaveNet 通过解决音高预测误差累积问题,能生成更自然且更具表现力的语音,并且比原始 WaveNet 拥有更简洁的推理流程。实验结果证明,本文提出的 SPSS 方法在客观和主观偏好测试中均能取得比利用原始 WaveNet 的现有最优方法更好的性能。

关键词

引用

@article{arxiv.1806.08619,
  title  = {Multi-task WaveNet: A Multi-task Generative Model for Statistical Parametric Speech Synthesis without Fundamental Frequency Conditions},
  author = {Yu Gu and Yongguo Kang},
  journal= {arXiv preprint arXiv:1806.08619},
  year   = {2018}
}

备注

Accepted by Interspeech 2018