神经TTS中文本驱动的情感风格控制与跨说话人风格迁移
计算与语言
2022-07-14 v1 机器学习
声音
音频与语音处理
摘要
近年来,表现力文本转语音取得了性能提升。然而,合成语音的风格控制常局限于离散情感类别,且需要目标说话人在目标风格下录制的训练数据。在许多实际场景中,用户可能并无目标情感下录制的参考语音,但仍希望通过键入所需情感风格的文本描述来控制语音风格。本文提出一种基于文本的多说话人 TTS 情感风格控制与跨说话人风格迁移接口。我们提出双模态风格编码器,借助预训练语言模型对文本描述嵌入与语音风格嵌入之间的语义关系建模。为进一步提升在 disjoint、多风格数据集上的跨说话人风格迁移,我们提出了新颖的风格损失。实验结果表明,我们的模型即便在未见风格下也能生成高质量表现力语音。
引用
@article{arxiv.2207.06000,
title = {Text-driven Emotional Style Control and Cross-speaker Style Transfer in Neural TTS},
author = {Yookyung Shin and Younggun Lee and Suhee Jo and Yeongtae Hwang and Taesu Kim},
journal= {arXiv preprint arXiv:2207.06000},
year = {2022}
}
备注
Accepted to Interspeech 2022