UDDETTS:统一离散情绪与维度情绪以实现可控情感文本转语音
机器学习
2025-09-26 v2 人工智能
计算与语言
摘要
近期的大型语言模型(LLM)在文本转语音(TTS)领域取得了显著进展,但在以可解释方式合成细粒度情感语音方面仍面临主要挑战。传统方法依赖离散情绪标签来控制情绪类别和强度,无法捕捉人类情感感知与表达的复杂性和连续性。缺乏具有平衡情绪分布和细粒度情感注释的大规模情感语音数据集常导致合成模型过拟合,阻碍有效情感控制。为此,我们提出了 UDDETTS,一个用于可控情感文本转语音的通用 LLM 框架,统一离散情绪和维度情绪。该模型引入可解释的唤醒-支配-情感(Arousal-Dominance-Valence, ADV)空间,用于维度情绪描述,支持基于离散情绪标签或非线性量化的 ADV 值驱动的情感控制。此外,设计了半监督训练策略,以综合利用来自不同类型情感注释的多样化语音数据集来训练 UDDETTS。实验表明,UDDETTS 在三个可解释维度上实现线性情感控制,并在端到端情感语音合成方面表现出优越性能。代码和演示可在 https://anonymous.4open.science/w/UDDETTS 查看。
引用
@article{arxiv.2505.10599,
title = {UDDETTS: Unifying Discrete and Dimensional Emotions for Controllable Emotional Text-to-Speech},
author = {Jiaxuan Liu and Yang Xiang and Han Zhao and Xiangang Li and Yingying Gao and Shilei Zhang and Zhenhua Ling},
journal= {arXiv preprint arXiv:2505.10599},
year = {2025}
}
备注
Under review