多说话人端到端语音合成的预训练策略、波形模型选择与声学配置
声音
2020-11-11 v1 计算与语言
摘要
我们探索了预训练策略,包括基础语料库的选择,旨在为零样本多说话人端到端合成选择最佳策略。我们还考察了用于波形合成的神经声码器选择,以及用于梅尔频谱图与最终音频输出的声学配置。我们发现,从通过简单质量阈值的有声书数据微调多说话人模型,可改善合成语音对未见目标说话人的自然度与相似度。此外,我们发现听者能区分16kHz与24kHz采样率,且WaveRNN产生的输出波形质量可与WaveNet相媲美,而推理时间更快。
引用
@article{arxiv.2011.04839,
title = {Pretraining Strategies, Waveform Model Choice, and Acoustic Configurations for Multi-Speaker End-to-End Speech Synthesis},
author = {Erica Cooper and Xin Wang and Yi Zhao and Yusuke Yasuda and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2011.04839},
year = {2020}
}
备注
Technical report