ConSinger:基于一致性模型的高保真高效唱声生成
声音
2025-03-10 v3 机器学习
音频与语音处理
摘要
唱声合成系统需要从给定的音乐谱子(歌词、时长和音高)生成高保真的唱声。最近,扩散模型在该领域表现良好。然而,为换取高质量样本生成,牺牲了推理速度,这限制了其应用场景。为更高效地获得高质量合成唱声,我们提出一种基于一致性模型的唱声合成方法ConSinger,通过最小步骤实现高保真唱声合成。该模型采用一致性约束进行训练,推理速度略有牺牲但生成质量得到显著提升。我们的实验表明,ConSinger在生成速度和质量方面与基线模型高度竞争。音频样本可在 https://keylxiao.github.io/consinger 查看。
引用
@article{arxiv.2410.15342,
title = {ConSinger: Efficient High-Fidelity Singing Voice Generation with Minimal Steps},
author = {Yulin Song and Guorui Sang and Jing Yu and Chuangbai Xiao},
journal= {arXiv preprint arXiv:2410.15342},
year = {2025}
}
备注
Singing voice synthesis, Consistency models, Shallow Diffusion Mechanism; Accepted by ICASSP 2025