面向端到端语音合成的跨说话人情感解耦与迁移
声音
2022-04-11 v2 音频与语音处理
摘要
文本到语音(TTS)合成中的跨说话人情感迁移任务特别旨在为目标说话人合成语音,其情感从另一(源)说话人录制的参考语音迁移而来。在情感迁移过程中,源说话人的身份信息也可能影响合成结果,导致说话人泄漏问题。本文提出一种新方法,旨在跨说话人情感 TTS 任务中合成可控的情感表现语音,同时保持目标说话人的身份。所提方法为基于 Tacotron2 的框架,以情感嵌入作为提供情感信息的调节变量。我们的方法包含两个情感解耦模块以 1)获取与说话人无关且具情感判别性的嵌入,以及 2)显式约束合成语音的情感与说话人身份符合预期。此外,我们提出了一种直观方法来控制目标说话人合成语音中的情感强度。具体而言,所学的情感嵌入通过灵活标量值进行调整,从而允许控制嵌入所传达的情感强度。我们在普通话离散语料库上进行了大量实验,结果表明所提方法能够为目标说话人合成合理的情感语音。与最先进的参考嵌入学习方法相比,我们的方法在跨说话人情感迁移任务上取得最佳性能,表明我们的方法在学习与说话人无关的情感嵌入上达到了新的 SOTA 性能。此外,强度排序测试与音高轨迹图表明,该方法能有效控制情感强度,产生韵律多样的合成语音。
引用
@article{arxiv.2109.06733,
title = {Cross-speaker emotion disentangling and transfer for end-to-end speech synthesis},
author = {Tao Li and Xinsheng Wang and Qicong Xie and Zhichao Wang and Lei Xie},
journal= {arXiv preprint arXiv:2109.06733},
year = {2022}
}