中文

EmoSteer-TTS:基于激活引导的细粒度训练-free 情感可控文本转语音

声音 2025-10-28 v3 人工智能 音频与语音处理

摘要

文本转语音(TTS)近年来取得了显著进展。然而,大多数现有 TTS 系统仅提供粗糙且僵化的情感控制,通常通过离散情感标签或精心设计的详细情感文本提示,导致细粒度情感操控要么不可访问,要么不稳定。这些模型还需要大量高质量的数据进行训练。为此,我们提出 EmoSteer-TTS,一种新颖的训练-free 方法,通过激活引导实现细粒度语音情感控制(转换、插值、擦除)。我们首先经验性地观察到,通过修改流匹配基础 TTS 模型中内部激活的子集,可有效改变合成语音的情感基调。基于此洞察,我们构建了一种训练-free 且高效的算法,包括激活提取、情感 token 搜索和推理时引导,能够无缝集成到广泛的预训练模型中(如 F5-TTS、CosyVoice2 和 E2-TTS)。此外,为获得有效的引导向量,我们构建了一个包含多样化说话人的精选情感语音数据集。广泛的实验表明,EmoSteer-TTS 实现了细粒度、可解释且连续的情感控制,超越了当前最先进(SOTA)的方法。据我们了解,这是首个实现 TTS 中训练-free 和连续细粒度情感控制的方法。演示样本可在 https://emosteer-tts-demo.pages.dev/ 查看。

关键词

引用

@article{arxiv.2508.03543,
  title  = {EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering},
  author = {Tianxin Xie and Shan Yang and Chenxing Li and Dong Yu and Li Liu},
  journal= {arXiv preprint arXiv:2508.03543},
  year   = {2025}
}

备注

25 pages, 9 figures, 3 tables