利用短时傅里叶变换与连续小波变换谱损失的神经语音波形模型训练
音频与语音处理
2019-04-09 v2 计算与语言
声音
机器学习
摘要
最近,我们提出了基于短时傅里叶变换(STFT)的损失函数用于训练神经语音波形模型。在本文中,我们推广上述框架,并提出了一种基于由 STFT 或连续小波变换(CWT)或二者共同获得的谱幅度与相位损失的此类模型训练方案。由于 CWT 能够具有不同于 STFT 的时间和频率分辨率,并能够考虑更接近人类听觉尺度的分辨率,所提出的损失函数可提供关于语音信号的互补信息。实验结果表明,使用所提出的 CWT 谱损失训练高质量模型是可行的,且其效果与使用基于 STFT 的损失相当。
引用
@article{arxiv.1903.12392,
title = {Training a Neural Speech Waveform Model using Spectral Losses of Short-Time Fourier Transform and Continuous Wavelet Transform},
author = {Shinji Takaki and Hirokazu Kameoka and Junichi Yamagishi},
journal= {arXiv preprint arXiv:1903.12392},
year = {2019}
}
备注
Submitted to Interspeech 2019, Graz, Austria