中文

EmoMix:基于扩散模型的情感混合语音合成方法

声音 2023-06-02 v1 音频与语音处理

摘要

近年来,情感文本转语音(TTS)合成技术取得了显著进展。然而,现有方法主要关注有限数量情感类型的合成,且在强度控制上表现不佳。为应对这些局限,我们提出 EmoMix,其可生成具有指定强度或混合情感的情感语音。具体而言,EmoMix 是一种基于扩散概率模型和可提取情感嵌入的预训练语音情感识别(SER)模型的可控情感 TTS 模型。混合情感合成通过在运行时仅一次采样过程中,结合由以不同情感为条件的扩散模型所预测噪声来实现。我们进一步将中性情感与特定主情感按不同程度混合以控制强度。实验结果验证了 EmoMix 在合成混合情感及强度控制上的有效性。

关键词

引用

@article{arxiv.2306.00648,
  title  = {EmoMix: Emotion Mixing via Diffusion Models for Emotional Speech Synthesis},
  author = {Haobin Tang and Xulong Zhang and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2306.00648},
  year   = {2023}
}

备注

Accepted by 24th Annual Conference of the International Speech Communication Association (INTERSPEECH 2023)