中文

合成歌手:基于深度学习的歌声合成方法综述

音频与语音处理 2026-01-22 v1 声音

摘要

歌声合成(SVS)的最新进展引起了学术界和工业界的广泛关注。随着大语言模型和新型生成范式的出现,生成可控、高保真的歌声已成为一个可实现的目标。然而,该领域仍缺乏一篇系统分析基于深度学习的歌声合成系统及其使能技术的全面综述。为解决上述问题,本综述首先按任务类型对现有系统进行分类,然后将当前架构组织为两大范式:级联方法和端到端方法。此外,我们对核心技术进行了深入分析,涵盖歌声建模和控制技术。最后,我们回顾了支持训练和评估的相关数据集、标注工具和评估基准。在附录中,我们介绍了训练策略和对 SVS 的进一步讨论。本综述提供了关于 SVS 模型的最新文献回顾,对研究人员和工程师都将是有用的参考。相关材料可在 https://github.com/David-Pigeon/SyntheticSingers 获取。

关键词

引用

@article{arxiv.2601.13910,
  title  = {Synthetic Singers: A Review of Deep-Learning-based Singing Voice Synthesis Approaches},
  author = {Changhao Pan and Dongyu Yao and Yu Zhang and Wenxiang Guo and Jingyu Lu and Zhiyuan Zhu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2601.13910},
  year   = {2026}
}

备注

Accepetd by IJCNLP-AACL 2025(Oral)