近期用于基于神经网络的语音合成的波形生成与声学建模方法比较
音频与语音处理
2018-04-10 v1 计算与语言
声音
机器学习
摘要
语音合成的最新进展表明,诸如最小相位近似下幅度谱的有损特性以及声学建模中的过平滑效应等局限,可借助先进的机器学习方法克服。本文构建一个框架,通过大规模众包评估公平比较新声码器与声学建模技术与传统方法。声学模型的结果显示,生成对抗网络与自回归(AR)模型优于普通循环网络,且 AR 模型表现最佳。使用同一 AR 声学模型对声码器的评估表明,Wavenet 声码器优于经典的基于源-滤波器声码器。特别地,由 AR 声学模型与 Wavenet 声码器组合生成的语音波形取得了与声码器处理语音相近的语音质量分数。
引用
@article{arxiv.1804.02549,
title = {A comparison of recent waveform generation and acoustic modeling methods for neural-network-based speech synthesis},
author = {Xin Wang and Jaime Lorenzo-Trueba and Shinji Takaki and Lauri Juvela and Junichi Yamagishi},
journal= {arXiv preprint arXiv:1804.02549},
year = {2018}
}
备注
To appear in ICASSP 2018