EmoSphere++:通过情感自适应球面向量实现情感可控的零样本文本转语音
声音
2025-04-18 v2 人工智能
音频与语音处理
摘要
情感文本转语音(TTS)技术近年来取得了显著进展,然而,由于情感本身的复杂性以及现有情感语音数据集和模型的局限性,仍面临挑战。此前的研究通常依赖有限的情感语音数据集或需要大量人工标注,这限制了其在不同说话人和情感风格之间的泛化能力。本文我们提出 EmoSphere++,一种可控制情感的零样本 TTS 模型,能够控制情感风格和强度以模仿自然人类语音。我们提出了一种新颖的情感自适应球面向量,无需人工标注即可建模情感风格和强度。此外,我们提出了一种多级风格编码器,能够确保对已见和未见说话人的有效泛化。我们还引入了额外的损失函数以增强零样本场景下的情感迁移性能。我们采用基于条件流匹配的解码器,在少量采样步骤中实现高质量且富有表现力的情感 TTS。实验结果证明了所提出框架的有效性。
引用
@article{arxiv.2411.02625,
title = {EmoSphere++: Emotion-Controllable Zero-Shot Text-to-Speech via Emotion-Adaptive Spherical Vector},
author = {Deok-Hyeon Cho and Hyung-Seok Oh and Seung-Bin Kim and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2411.02625},
year = {2025}
}