GELP:用于梅尔谱图语音合成的 GAN 激励线性预测
音频与语音处理
2019-06-27 v3 机器学习
声音
摘要
基于神经网络的文本转语音近期在合成语音自然度上已达人类水平。现有序列到序列模型可直接将文本映射为梅尔谱图声学特征,便于建模,但给声码器(即从声学特征生成波形)带来额外挑战。神经声码器如 WaveNet 可实现高质量合成,但此类自回归模型受限于缓慢的串行推理。同时,现有并行推理对应模型难以训练且模型规模日益庞大。本文提出一种利用生成对抗网络(GAN)训练并行神经声码器的替代策略,并将线性预测合成滤波器集成入模型。结果表明,所提模型在推理速度上显著提升,且在复制合成质量上优于 WaveNet。
引用
@article{arxiv.1904.03976,
title = {GELP: GAN-Excited Linear Prediction for Speech Synthesis from Mel-spectrogram},
author = {Lauri Juvela and Bajibabu Bollepalli and Junichi Yamagishi and Paavo Alku},
journal= {arXiv preprint arXiv:1904.03976},
year = {2019}
}
备注
Interspeech 2019 accepted version