基于韵律补偿的端到端语音合成跨说话人情感迁移
声音
2022-07-05 v1 音频与语音处理
摘要
跨说话人情感迁移语音合成旨在通过将另一(源)说话人录制的参考语音中的情感迁移过来,为目标说话人合成情感语音。在该任务中,从参考语音中提取说话人无关的情感嵌入起着重要作用。然而,此类情感嵌入所传达的情感信息在挤压掉源说话人音色信息的过程中往往被削弱。针对该问题,本文提出一种韵律补偿模块(PCM)来补偿情感信息损失。具体而言,PCM试图从预训练ASR模型的中间特征中获取说话人无关的情感信息。为此,引入了带全局上下文(GC)块的韵律补偿编码器,以从ASR模型的中间特征中获取全局情感信息。实验表明,所提PCM能有效补偿情感嵌入的情感信息损失,同时保持目标说话人的音色。与SOTA模型的对比显示,我们提出的方法在跨说话人情感迁移任务上具有明显优势。
引用
@article{arxiv.2207.01198,
title = {Cross-speaker Emotion Transfer Based On Prosody Compensation for End-to-End Speech Synthesis},
author = {Tao Li and Xinsheng Wang and Qicong Xie and Zhichao Wang and Mingqi Jiang and Lei Xie},
journal= {arXiv preprint arXiv:2207.01198},
year = {2022}
}