中文

Tutti:通过结构级音色控制和人声纹理建模实现多歌手合成

声音 2026-02-10 v1 人工智能

摘要

虽然现有的演唱声合成系统在实现高保真率的单人演唱方面取得了进展,但它们受限于全局音色控制,无法解决单首歌曲中动态的多歌手编排和人声纹理问题。为此,我们提出Tutti,一个为结构化多歌手生成设计的统一框架。具体而言,我们引入结构感知歌手提示 (Structure-Aware Singer Prompt),以实现随音乐结构演化的灵活歌手调度;并提出Condition-Guided VAE中的互补纹理学习 (Complementary Texture Learning),以捕获隐式声学纹理 (如空间混响和谱融合),这些纹理补充于显式控制。实验表明,Tutti在精确的多歌手调度方面表现出色,显著提升了合唱生成的声学真实性,为复杂的多歌手编排提供了一种新范式。音频样本可在 https://annoauth123-ctrl.github.io/Tutii_Demo/ 查看。

关键词

引用

@article{arxiv.2602.08233,
  title  = {Tutti: Expressive Multi-Singer Synthesis via Structure-Level Timbre Control and Vocal Texture Modeling},
  author = {Jiatao Chen and Xing Tang and Xiaoyue Duan and Yutang Feng and Jinchao Zhang and Jie Zhou},
  journal= {arXiv preprint arXiv:2602.08233},
  year   = {2026}
}