MASS:多任务拟人化语音合成框架
声音
2021-05-11 v1 音频与语音处理
摘要
文本到语音(TTS)合成在人机交互中起着重要作用。目前,大多数 TTS 技术关注语音的自然度,即使语音听起来像人类。然而,情感表达和说话人身份这些关键任务被忽视,限制了 TTS 合成技术的应用情景。为使合成语音更逼真并拓展应用情景,我们提出一种多任务拟人化语音合成框架(MASS),其能从具有指定情感和说话人身份的文本合成语音。MASS 框架由一个基础 TTS 模块和两个新颖的语音转换模块组成:情感语音转换模块和说话人语音转换模块。我们提出基于卷积残差网络的深度情感语音转换模型(DEVC)和深度说话人语音转换模型(DSVC)。它解决了语音转换过程中特征丢失的问题。模型训练独立于平行数据集,并且能够进行多对多语音转换。在情感语音转换、说话人语音转换以及多任务语音合成实验中,实验结果表明 DEVC 和 DSVC 能有效转换语音。多任务语音合成实验的定量与定性评估结果表明,MASS 能有效合成具有指定文本、情感和说话人身份的语音。
引用
@article{arxiv.2105.04124,
title = {MASS: Multi-task Anthropomorphic Speech Synthesis Framework},
author = {Jinyin Chen and Linhui Ye and Zhaoyan Ming},
journal= {arXiv preprint arXiv:2105.04124},
year = {2021}
}