DisCo-Speech:基于解耦语音编解码器的可控零样本语音生成
声音
2026-01-06 v3
摘要
基于编解码器的语言模型(LM)彻底改变了文本到语音(TTS)合成。然而,标准编解码器将音色和韵律纠缠在一起,阻碍了基于延续的 LM 中的独立控制。为应对这一挑战,我们提出了 DisCo-Speech,一个零样本可控 TTS 框架,其核心是解耦语音编解码器(DisCodec)和基于 LM 的生成器。DisCodec 的核心组件采用两阶段设计:1)通过并行编码器和混合损失进行三因子解耦,将语音分离为内容、韵律和音色子空间;2)融合与重建,将内容和韵律合并为统一的内容-韵律令牌以供 LM 预测,同时联合优化重建以解决解耦-重建之间的权衡。这使得 LM 能够从风格提示中进行韵律延续,而解码器则注入目标音色,从而实现灵活的零样本控制。实验表明,DisCo-Speech 实现了具有竞争力的声音克隆和优越的零样本韵律控制。通过在编解码器层面解决核心的纠缠问题,DisCo-Speech 为可控语音合成提供了稳健的基础。
引用
@article{arxiv.2512.13251,
title = {DisCo-Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec},
author = {Tao Li and Wenshuo Ge and Zhichao Wang and Zihao Cui and Yong Ma and Yingying Gao and Chao Deng and Shilei Zhang and Junlan Feng},
journal= {arXiv preprint arXiv:2512.13251},
year = {2026}
}
备注
Updated with 6,000 hours of additional training data and improved performance. Expanded appendix with ablation studies, training objectives, and hyperparameter settings for better reproducibility. Audio and code links included