Prompt-Singer:基于自然语言提示的可控歌声合成
声音
2025-01-07 v3 人工智能
机器学习
音频与语音处理
摘要
近期的歌声合成(SVS)方法已实现了出色的音频质量与自然度,但缺乏显式控制合成歌声风格属性的能力。我们提出 Prompt-Singer,这是首个能够利用自然语言对歌手性别、音域和音量进行属性控制的 SVS 方法。我们采用基于仅解码器 Transformer 与多尺度层级的模型架构,并设计了一种音域-旋律解耦的音高表示,使得在保持旋律准确性的同时实现文本条件下的音域控制。此外,我们探索了多种实验设置,包括不同类型的文本表示、文本编码器微调以及引入语音数据以缓解数据稀缺问题,旨在促进后续研究。实验表明,我们的模型实现了良好的控制能力与音频质量。音频样本可在 http://prompt-singer.github.io 获取。
关键词
引用
@article{arxiv.2403.11780,
title = {Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt},
author = {Yongqi Wang and Ruofan Hu and Rongjie Huang and Zhiqing Hong and Ruiqi Li and Wenrui Liu and Fuming You and Tao Jin and Zhou Zhao},
journal= {arXiv preprint arXiv:2403.11780},
year = {2025}
}
备注
Accepted by NAACL 2024 (main conference)