中文

VoxCPM:面向上下文感知语音生成与逼真语音克隆的无分词器 TTS

声音 2025-09-30 v1

摘要

语音合成的生成式模型面临一个基本的权衡:离散 token 确保了稳定性但牺牲了表达能力,而连续信号保留了声学丰富性但由于任务纠缠而遭受误差累积。这一挑战推动了该领域向依赖预训练语音分词器的多阶段流程发展,但这造成了语义-声学割裂,限制了整体且富有表现力的语音生成。我们通过具有半离散残差表示的分层语义-声学建模解决了这一困境,并提出了一种新颖的无分词器 TTS 模型 VoxCPM。我们的框架引入了一个可微量化瓶颈,诱导出自然的专业化:文本语义语言模型(TSLM)生成语义-韵律计划,而残差声学模型(RALM)恢复细粒度的声学细节。这种分层语义-声学表示引导局部基于扩散的解码器生成高保真语音潜变量。至关重要的是,整个架构在简单的扩散目标下进行端到端训练,消除了对外部语音分词器的依赖。在 180 万小时的双语语料库上进行训练后,我们的 VoxCPM-0.5B 模型在开源系统中实现了最先进的零样本 TTS 性能,证明了我们的方法能够提供富有表现力且稳定的合成。此外,VoxCPM 展示了理解文本以推断并生成适当韵律和风格的能力,提供具有上下文感知表达能力和自然流畅度的语音。为了促进社区驱动的研究与开发,VoxCPM 在 Apache 2.0 许可下公开提供。

关键词

引用

@article{arxiv.2509.24650,
  title  = {VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning},
  author = {Yixuan Zhou and Guoyang Zeng and Xin Liu and Xiang Li and Renjie Yu and Ziyang Wang and Runchuan Ye and Weiyue Sun and Jiancheng Gui and Kehan Li and Zhiyong Wu and Zhiyuan Liu},
  journal= {arXiv preprint arXiv:2509.24650},
  year   = {2025}
}

备注

Technical Report