中文

统计参数语音合成中数据驱动参数化的深度学习方法

计算与语言 2014-10-01 v1 机器学习 神经与进化计算

摘要

当今几乎所有的统计参数语音合成器都使用 Mel 倒谱系数作为语音信号的声道参数化。Mel 倒谱系数从未打算用于参数化语音合成框架,但迄今为止,在创建更适合合成的更好参数化方面几乎没有成功。在本文中,我们利用深度学习算法研究了一种专为合成特定需求而设计的数据驱动参数化技术。通过训练一个渐缩堆叠去噪自编码器 (tapered Stacked Denoising Autoencoder, SDA),我们创建了 Mel 对数谱的可逆、低维且抗噪声编码。随后将该 SDA 展开并用作多层感知机 (MLP) 的初始化。通过训练该 MLP 在输出层重构输入对其进行微调。然后将该 MLP 从中间分割,形成编码和解码网络。这些网络产生的 Mel 对数谱参数化旨在更好地满足合成需求。报告了使用此结果参数化与 ClusterGen 语音合成器进行实验的结果。

关键词

引用

@article{arxiv.1409.8558,
  title  = {A Deep Learning Approach to Data-driven Parameterizations for Statistical Parametric Speech Synthesis},
  author = {Prasanna Kumar Muthukumar and Alan W. Black},
  journal= {arXiv preprint arXiv:1409.8558},
  year   = {2014}
}