TCSinger 2:可定制化的多语言零样本唱歌语音合成
音频与语音处理
2025-08-22 v3 计算与语言
声音
摘要
可定制化的多语言零样本唱歌语音合成(SVS)在音乐创作和短视频配音等领域具有多种潜在应用。然而,现有的SVS模型过度依赖音素和音符边界注释,这限制了其在零样本场景中的鲁棒性,并导致音素与音符之间产生较差的过渡。此外,这些模型也缺乏通过多样化提示实现有效的多层次风格控制。为克服这些挑战,我们引入了TCSinger 2,这是一个基于各种提示进行风格迁移和风格控制的多任务多语言零样本SVS模型。TCSinger 2主要包括三个关键模块:1)模糊边界内容(Blurred Boundary Content, BBC)编码器,预测时长,扩展内容嵌入,并对边界应用掩码,以实现平滑过渡。2)自定义音频编码器(Custom Audio Encoder),使用对比学习从唱歌、语音和文本提示中提取对齐的表示。3)基于流的自定义变换器(Flow-based Custom Transformer),利用Cus-MOE,并受F0监督,提高了合成语音的质量和风格建模。实验结果表明,TCSinger 2在多个相关任务中,在主观和客观指标上均优于基线模型。唱歌语音样本可在 https://aaronz345.github.io/TCSinger2Demo/ 查看。
引用
@article{arxiv.2505.14910,
title = {TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis},
author = {Yu Zhang and Wenxiang Guo and Changhao Pan and Dongyu Yao and Zhiyuan Zhu and Ziyue Jiang and Yuhan Wang and Tao Jin and Zhou Zhao},
journal= {arXiv preprint arXiv:2505.14910},
year = {2025}
}
备注
Accepted by Findings of ACL 2025