中文

TCSinger:基于风格迁移与多级风格控制的零样图唱声合成

音频与语音处理 2025-06-02 v6 计算与语言 声音

摘要

零样图唱声合成(SVS)通过风格迁移和风格控制旨在生成具有未见时音色和风格(包括唱法、情感、节奏、技巧和发音)的高质量唱声。然而,唱声风格的多层次特性为有效建模、迁移和控制带来了显著挑战。此外,当前的 SVS 模型往往难以为未见 singer 生成富有风格细节的唱声。为此,我们引入 TCSinger——首个实现跨语言语音与唱声风格迁移,并支持多级风格控制的零零-shot SVS 模型。具体而言,TCSinger 提出三个主要模块:1)聚类风格编码器采用聚类向量量化模型将风格信息稳定地压缩至紧凑的潜在空间;2)风格与时长语言模型(S\&D-LM)同时预测风格信息和音素时长,两者互相促进;3)风格自适应解码器采用新颖的 mel-style 自适应归一化方法,以增强细节地生成唱声。实验结果表明,TCSinger 在合成质量、singer 相似度和风格可控性方面优于所有基线模型,涵盖零-shot 风格迁移、多级风格控制、跨语言风格迁移和 speech-to-singing 风格迁移等多种任务。唱声样本可访问 https://aaronz345.github.io/TCSingerDemo/。

关键词

引用

@article{arxiv.2409.15977,
  title  = {TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control},
  author = {Yu Zhang and Ziyue Jiang and Ruiqi Li and Changhao Pan and Jinzheng He and Rongjie Huang and Chuxin Wang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2409.15977},
  year   = {2025}
}

备注

Accepted by EMNLP 2024