中文

ControlSpeech:迈向同时且独立的零样本说话人克隆与零样本语言风格控制

音频与语音处理 2025-06-05 v3 机器学习 声音

摘要

在本文中,我们提出了ControlSpeech,一个能够完全克隆说话人声音并实现任意控制和调整说话风格的文本转语音(TTS)系统。先前的零样本TTS模型仅模仿说话人声音而不具备进一步的控制和调整能力,而先前的可控TTS模型无法进行特定说话人的语音生成。因此,ControlSpeech专注于一个更具挑战性的任务:一个同时可控音色、内容和风格的TTS系统。ControlSpeech以语音提示、内容提示和风格提示作为输入,并利用双向注意力和基于掩码的并行解码,在离散解耦编解码空间中捕获对应于音色、内容和风格的编解码表示。此外,我们分析了文本风格控制中的多对多问题,并提出了基于高斯混合密度网络的风格混合语义密度(SMSD)模块来解决此问题。为促进实证验证,我们提供了一个新的风格可控数据集VccmDataset。我们的实验结果表明,ControlSpeech在可控性、音色相似度、音频质量、鲁棒性和泛化性方面表现出可比或最先进(SOTA)的性能。相关代码和演示可在https://github.com/jishengpeng/ControlSpeech获取。

关键词

引用

@article{arxiv.2406.01205,
  title  = {ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control},
  author = {Shengpeng Ji and Qian Chen and Wen Wang and Jialong Zuo and Minghui Fang and Ziyue Jiang and Hai Huang and Zehan Wang and Xize Cheng and Siqi Zheng and Zhou Zhao},
  journal= {arXiv preprint arXiv:2406.01205},
  year   = {2025}
}

备注

ACL 2025 Main