中文

一种用于统计参数语音合成的分层生成幅度与相位谱的神经声码器

声音 2020-02-06 v2 音频与语音处理

摘要

本文提出一种名为 HiNet 的神经声码器(vocoder),其通过分层预测幅度谱与相位谱从声学特征重建语音波形。与 WaveNet、SampleRNN 和 WaveRNN 等使用单一神经网络直接生成波形采样的现有神经声码器不同,HiNet 声码器由幅度谱预测器(ASP)和相位谱预测器(PSP)组成。ASP 是一个简单的 DNN 模型,从声学特征预测对数幅度谱(LAS)。预测的 LAS 被送入 PSP 以进行相位恢复。考虑到相位卷绕问题及相位建模的困难,PSP 由神经源-滤波器(NSF)波形生成器与相位提取器级联构成。我们还将生成对抗网络(GANs)引入 ASP 与 PSP。最后,ASP 与 PSP 的输出通过短时傅里叶合成相结合以重建语音波形。由于两个预测器中均无自回归结构,HiNet 声码器可高效地生成语音波形。客观与主观实验结果表明,我们提出的 HiNet 声码器在重建语音的自然度上优于传统的 STRAIGHT 声码器、使用开源实现的 16-bit WaveNet 声码器以及复杂度与 PSP 相近的 NSF 声码器,并取得与 16-bit WaveRNN 声码器相近的性能。我们还发现 HiNet 的性能在某种程度上对 PSP 中神经波形生成器的复杂度不敏感。在简化其模型结构后,使用 GPU 生成 1 秒 16kHz 语音波形所耗时间可进一步从 0.34 秒降至 0.19 秒,且质量无明显下降。

关键词

引用

@article{arxiv.1906.09573,
  title  = {A Neural Vocoder with Hierarchical Generation of Amplitude and Phase Spectra for Statistical Parametric Speech Synthesis},
  author = {Yang Ai and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:1906.09573},
  year   = {2020}
}

备注

Published in IEEE Transactions on Audio, Speech and Language Processing