序列到序列语音合成中对语言特征学习能力的探究
音频与语音处理
2020-10-08 v2 计算与语言
声音
机器学习
摘要
神经序列到序列文本到语音合成(TTS)可直接从文本或诸如音素之类的简单语言特征生成高质量语音。不同于传统流水线 TTS,神经序列到序列 TTS 不需要手动标注且复杂的语言特征(如词性标签和句法结构)用于系统训练。然而,它必须被精心设计并良好优化,方能从输入特征中隐式提取有用的语言特征。在本文中,我们探究在何种条件下神经序列到序列 TTS 能在日语和英语中良好工作,并与基于深度神经网络(DNN)的流水线 TTS 系统进行比较。不同于过往的比较研究,流水线系统也使用自回归概率建模和神经声码器。我们从三个方面探究系统:a) 模型架构,b) 模型参数规模,以及 c) 语言。对于模型架构方面,我们采用先前提出的改进 Tacotron 系统及使用来自 Tacotron 或 Tacotron2 编码器的变体。对于模型参数规模方面,我们考察两种模型参数规模。对于语言方面,我们在日语和英语中均进行听感测试,以观察我们的发现是否能跨语言泛化。我们的实验表明:a) 神经序列到序列 TTS 系统应具备足够数量的模型参数以产生高质量语音,b) 当其以字符为输入时还应使用强大的编码器,以及 c) 编码器仍有改进空间,需要具有改进架构以更恰当地学习超音段特征。
引用
@article{arxiv.2005.10390,
title = {Investigation of learning abilities on linguistic features in sequence-to-sequence text-to-speech synthesis},
author = {Yusuke Yasuda and Xin Wang and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2005.10390},
year = {2020}
}