中文

TTS-CtrlNet: 基于 ControlNet 的时间变化情感对齐文本转语音生成

声音 2025-07-08 v1 音频与语音处理

摘要

近期的文本转语音(TTS)技术已实现自然语音合成,但细粒度、时间变化的情感控制仍具有挑战。现有方法通常仅支持utterance级控制,且需要对大型情感语音数据集进行全模型微调,这会降低性能。灵感来自在 ControlNet(Zhang 等,2023)中为现有模型添加条件控制,我们提出了首个基于 ControlNet 的可控流匹配 TTS 方法(TTS-CtrlNet),该方法冻结原始模型并引入其可训练副本以处理额外条件。我们表明,TTS-CtrlNet 能够通过添加直观、可扩展且时间变化的情感控制来提升预训练的大型 TTS 模型性能,同时继承原始模型的能力(如零样语音克隆与自然度)。此外,我们提供了添加情感控制的实用方案:1)基于块分析的最佳架构设计选择,2)情感特定流步骤,3)灵活的控制比例。实验表明,我们的方法能够有效地为现有 TTS 添加情感控制器,并实现最先进的性能,情感相似度得分:Emo-SIM 和 Aro-Val SIM。项目页面可访问于:https://curryjung.github.io/ttsctrlnet_project_page

关键词

引用

@article{arxiv.2507.04349,
  title  = {TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet},
  author = {Jaeseok Jeong and Yuna Lee and Mingi Kwon and Youngjung Uh},
  journal= {arXiv preprint arXiv:2507.04349},
  year   = {2025}
}