中文

TechSinger:基于流匹配实现可控多语言唱声合成

声音 2025-04-22 v2

摘要

唱声合成技术近期在生成自然高质量语音方面取得了显著进展。然而,现有方法很少提供对声部技巧(如力度、混合音、falsetto、气泡和气声等)的精确控制,限制了合成语音的表现潜力。我们介绍TechSinger,这是一个支持五种语言和七种声部技巧的可控唱声合成系统。TechSinger利用基于流匹配的生成模型,实现对各种声部技巧的增强式表达控制。为提升训练数据的多样性,我们开发了一个技巧检测模型,自动为数据集添加音素级技巧标签。此外,我们的基于提示词的技巧预测模型使用户能够通过自然语言指定所需的声部属性,从而实现对合成唱声的细粒度控制。实验结果表明,TechSinger在合成唱声的表达性和真实性方面显著优于现有方法,在音频质量和技巧特定控制方面表现更佳。音频样本可在https://gwx314.github.io/tech-singer/ 查看。

关键词

引用

@article{arxiv.2502.12572,
  title  = {TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching},
  author = {Wenxiang Guo and Yu Zhang and Changhao Pan and Rongjie Huang and Li Tang and Ruiqi Li and Zhiqing Hong and Yongqi Wang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2502.12572},
  year   = {2025}
}

备注

Accepted by AAAI 2025