用于训练神经语音波形模型的 STFT 谱损失
音频与语音处理
2018-10-31 v2 计算与语言
声音
机器学习
摘要
本文提出一种利用短时傅里叶变换(STFT)谱的新损失,旨在训练可直接预测原始连续语音波形样本的高性能神经语音波形模型。所提损失不仅使用由生成语音波形得到的幅度谱,还使用相位谱。我们还从数学上表明,基于所提损失对波形模型进行训练可解释为最大似然训练,其假设生成语音波形的幅度谱与相位谱分别服从高斯分布与 von Mises 分布。此外,本文给出一种作为语音波形模型的简单网络结构,其由单向长短期记忆(LSTM)网络与自回归结构组成。实验结果表明,所提神经模型合成了高质量语音波形。
引用
@article{arxiv.1810.11945,
title = {STFT spectral loss for training a neural speech waveform model},
author = {Shinji Takaki and Toru Nakashika and Xin Wang and Junichi Yamagishi},
journal= {arXiv preprint arXiv:1810.11945},
year = {2018}
}
备注
Submitted to the 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)