面向分层神经声码器的知识与数据驱动幅度谱预测
音频与语音处理
2020-05-19 v2 声音
摘要
在我们之前的工作中,我们提出了一种称为 HiNet 的神经声码器,它通过从输入声学特征分层预测幅度谱和相位谱来恢复语音波形。在 HiNet 中,幅度谱预测器(ASP)从输入声学特征预测对数幅度谱(LAS)。本文提出一种新颖的知识与数据驱动的 ASP(KDD-ASP)以改进传统 ASP。首先,声学特征(即 F0 和 mel-cepstra)通过知识驱动的 LAS 恢复模块以获得近似 LAS(ALAS)。该模块基于 STFT 与源-滤波器理论的结合而设计,其中源部分和滤波器部分分别基于输入 F0 和 mel-cepstra 设计。然后,恢复得到的 ALAS 由数据驱动的 LAS 细化模块处理,该模块由多个可训练卷积层组成,以得到最终 LAS。实验结果表明,在文本到语音(TTS)任务上,使用 KDD-ASP 的 HiNet 声码器比使用传统 ASP 的声码器以及 WaveRNN 声码器能取得更高质量的合成语音。
引用
@article{arxiv.2004.07832,
title = {Knowledge-and-Data-Driven Amplitude Spectrum Prediction for Hierarchical Neural Vocoders},
author = {Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2004.07832},
year = {2020}
}
备注
Submitted to Interspeech 2020