中文

利用堆叠瓶颈特征与最小生成误差训练改进基于DNN的语音合成中的轨迹建模

声音 2016-11-17 v3 计算与语言 神经与进化计算

摘要

我们提出两种新技术——堆叠瓶颈特征与最小生成误差训练准则——以改进基于深度神经网络(DNN)的语音合成性能。这些技术解决了当前典型基于DNN的合成框架中逐帧独立性以及忽视静态与动态特征间关系的相关问题。堆叠瓶颈特征是一种声学知情的语音表征,提供了一种在输入中包含更详细语言上下文的有效方式。最小生成误差训练准则最小化整个语句的总体输出轨迹误差,而非独立地最小化每帧误差,从而考虑了静态与动态特征之间的相互作用。这两种技术可轻松结合以进一步提升性能。我们给出了客观与主观结果,证明了所提技术的有效性。主观结果表明,结合两种技术比常规DNN或长短期记忆(LSTM)循环神经网络(RNN)系统生成的合成语音显著更自然。

关键词

引用

@article{arxiv.1602.06727,
  title  = {Improving Trajectory Modelling for DNN-based Speech Synthesis by using Stacked Bottleneck Features and Minimum Generation Error Training},
  author = {Zhizheng Wu and Simon King},
  journal= {arXiv preprint arXiv:1602.06727},
  year   = {2016}
}

备注

submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing 2016 (AQ)