中文

通过对比学习与扩散模型运用自然语言指导增强情感文本转语音的可控性

声音 2024-09-11 v1 音频与语音处理

摘要

虽然当前情感文本转语音(TTS)系统能够生成高度可理解的情感语音,但实现对输出语音情感渲染的精细控制仍是重大挑战。本文引入ParaEVITS,一种新型情感TTS框架,利用自然语言的组合性来增强对情感渲染的控制。通过融合受ParaCLAP启发的文本-音频编码器,该扩散模型被训练生成基于文本情感风格描述的情感嵌入。我们的框架首先在参考音频上进行训练,然后微调扩散模型以处理来自ParaCLAP文本编码器的文本输入。在推断阶段,仅通过文本条件即可操控语音属性,如基频、抖动和音量。我们的实验表明,ParaEVITS能够在不损害语音质量的前提下有效控制情感渲染。语音演示已公开提供。

关键词

引用

@article{arxiv.2409.06451,
  title  = {Enhancing Emotional Text-to-Speech Controllability with Natural Language Guidance through Contrastive Learning and Diffusion Models},
  author = {Xin Jing and Kun Zhou and Andreas Triantafyllopoulos and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2409.06451},
  year   = {2024}
}