中文

SoulX-Singer:面向高质量零样态唱声合成

音频与语音处理 2026-03-17 v2 人工智能 声音

摘要

虽然近年来在语音合成领域取得了快速进展,但开源唱声合成系统仍面临鲁棒性和零样态泛化等显著障碍,尤其难以实现工业化部署。本报告介绍了SoulX-Singer,一个注重实际部署考虑的高质量开源唱声合成系统。SoulX-Singer 支持基于符号音乐谱分(MIDI)或旋律表示的可控唱声生成,实现了在实际生产工作流程中的灵活且具表现力的控制。系统基于超过 42,000 小时的人声数据训练,支持普通话、英语和粤语,在各种音乐条件下始终实现最先进的合成质量。此外,为实现可靠的零样态唱声合成性能评估,我们构建了 SoulX-Singer-Eval,一个严格区分训练与测试的专门基准,便于在零样态设置下进行系统评估。

关键词

引用

@article{arxiv.2602.07803,
  title  = {SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice Synthesis},
  author = {Jiale Qian and Hao Meng and Tian Zheng and Pengcheng Zhu and Haopeng Lin and Yuhang Dai and Hanke Xie and Wenxiao Cao and Ruixuan Shang and Jun Wu and Hongmei Liu and Hanlin Wen and Jian Zhao and Zhonglin Jiang and Yong Chen and Shunshun Yin and Ming Tao and Jianguo Wei and Lei Xie and Xinsheng Wang},
  journal= {arXiv preprint arXiv:2602.07803},
  year   = {2026}
}

备注

Technical Report