中文

GELP:用于梅尔谱图语音合成的 GAN 激励线性预测

音频与语音处理 2019-06-27 v3 机器学习 声音

摘要

基于神经网络的文本转语音近期在合成语音自然度上已达人类水平。现有序列到序列模型可直接将文本映射为梅尔谱图声学特征,便于建模,但给声码器(即从声学特征生成波形)带来额外挑战。神经声码器如 WaveNet 可实现高质量合成,但此类自回归模型受限于缓慢的串行推理。同时,现有并行推理对应模型难以训练且模型规模日益庞大。本文提出一种利用生成对抗网络(GAN)训练并行神经声码器的替代策略,并将线性预测合成滤波器集成入模型。结果表明,所提模型在推理速度上显著提升,且在复制合成质量上优于 WaveNet。

关键词

引用

@article{arxiv.1904.03976,
  title  = {GELP: GAN-Excited Linear Prediction for Speech Synthesis from Mel-spectrogram},
  author = {Lauri Juvela and Bajibabu Bollepalli and Junichi Yamagishi and Paavo Alku},
  journal= {arXiv preprint arXiv:1904.03976},
  year   = {2019}
}

备注

Interspeech 2019 accepted version