DMP-TTS:基于链式引导的可控文本转语音的解耦多模态提示
声音
2025-12-11 v1
摘要
可控文本转语音(TTS)系统在实现说话者音色与说话风格的独立操控方面面临重大挑战,通常遭受这些属性之间的纠缠。我们提出了DMP-TTS,一个具有显式解耦和多模态提示的潜在扩散Transformer(DiT)框架。基于CLAP的风格编码器(Style-CLAP)在共享空间中对齐参考音频和描述性文本的提示,并通过对比学习加风格属性的多任务监督进行训练。为了在推理过程中实现细粒度控制,我们引入了通过分层条件dropout训练的链式无分类器引导(cCFG),实现了内容、音色和风格引导强度的独立调整。此外,我们采用表示对齐(REPA)将预训练Whisper模型中的声学-语义特征蒸馏到中间DiT表示中,稳定训练并加速收敛。实验表明,DMP-TTS在保持有竞争力的可懂度和自然度的同时,比开源基线提供了更强的风格可控性。代码和演示将在 https://y61329697.github.io/DMP-TTS/ 上公开。
引用
@article{arxiv.2512.09504,
title = {DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance},
author = {Kang Yin and Chunyu Qiang and Sirui Zhao and Xiaopeng Wang and Yuzhe Liang and Pengfei Cai and Tong Xu and Chen Zhang and Enhong Chen},
journal= {arXiv preprint arXiv:2512.09504},
year = {2025}
}