用于统计参数语音合成的神经源-滤波器波形模型
摘要
WaveNet 等神经波形模型已展现出优于传统声码器的统计参数语音合成性能。作为自回归(AR)模型,WaveNet 受限于缓慢的序列波形生成过程。一些使用逆自回归流(IAF)的新模型可以一次性生成整个波形。然而,这些基于 IAF 的模型在训练时需要序列变换,严重拖慢了训练速度。其他如 Parallel WaveNet 与 ClariNet 的模型结合了 AR 与基于 IAF 模型的优点,并通过将知识从预训练的 AR 教师迁移到 IAF 学生来训练 IAF 模型,无需任何序列变换。但两者都需要额外的训练准则,且实现极为复杂。我们提出了一种不使用 AR 也不使用基于 IAF 方法的神经源-滤波器(NSF)波形建模框架。该框架仅需三个组件用于波形生成:生成基于正弦的激励信号作为激励的源模块、将激励变换为波形的非 AR 扩张卷积滤波器模块,以及为源与滤波器模块预处理声学特征的条件模块。该框架最小化谱幅度距离用于模型训练,可利用短时傅里叶变换例程高效实现。在此框架下,我们设计了三种 NSF 模型并与 WaveNet 比较。结果表明,NSF 模型生成波形至少比 WaveNet 快 100 倍,且最佳 NSF 模型合成语音的质量优于或与 WaveNet 相当。
引用
@article{arxiv.1904.12088,
title = {Neural source-filter waveform models for statistical parametric speech synthesis},
author = {Xin Wang and Shinji Takaki and Junichi Yamagishi},
journal= {arXiv preprint arXiv:1904.12088},
year = {2019}
}
备注
Accepted to IEEE/ACM TASLP. Note: this paper is on a follow-up work of our ICASSP paper. Based on the h-NSF introduced in this work, we proposed a h-sinc-NSF model and published the third paper in SSW 10 (https://www.isca-speech.org/archive/SSW_2019/pdfs/SSW10_O_1-1.pdf)