中文

Prompt-Singer:基于自然语言提示的可控歌声合成

声音 2025-01-07 v3 人工智能 机器学习 音频与语音处理

摘要

近期的歌声合成(SVS)方法已实现了出色的音频质量与自然度,但缺乏显式控制合成歌声风格属性的能力。我们提出 Prompt-Singer,这是首个能够利用自然语言对歌手性别、音域和音量进行属性控制的 SVS 方法。我们采用基于仅解码器 Transformer 与多尺度层级的模型架构,并设计了一种音域-旋律解耦的音高表示,使得在保持旋律准确性的同时实现文本条件下的音域控制。此外,我们探索了多种实验设置,包括不同类型的文本表示、文本编码器微调以及引入语音数据以缓解数据稀缺问题,旨在促进后续研究。实验表明,我们的模型实现了良好的控制能力与音频质量。音频样本可在 http://prompt-singer.github.io 获取。

关键词

引用

@article{arxiv.2403.11780,
  title  = {Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt},
  author = {Yongqi Wang and Ruofan Hu and Rongjie Huang and Zhiqing Hong and Ruiqi Li and Wenrui Liu and Fuming You and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2403.11780},
  year   = {2025}
}

备注

Accepted by NAACL 2024 (main conference)