RDSinger:用于歌声合成的基于参考的扩散网络
声音
2024-10-30 v1 人工智能
音频与语音处理
摘要
歌声合成(Singing Voice Synthesis, SVS)旨在从乐谱生成高保真歌声音频,与文本到语音任务不同,它需要对音符、音高和时长的详细理解。尽管扩散模型在图像和视频生成等各种生成任务中表现出了卓越的性能,但其在 SVS 中的应用受到了时间复杂度和捕捉声学特征(尤其是在音高转换期间)的挑战的阻碍。一些网络从先验分布中学习,并使用压缩的潜状态作为扩散模型中更好的起点,但去噪步骤并未在整个时长内持续提升质量。我们引入了 RDSinger,一种基于参考的去噪扩散网络,可为 SVS 任务生成高质量音频。我们的方法受 Animate Anyone 启发,这是一种从参考图像中保持复杂外观特征的扩散图像网络。RDSinger 利用 FastSpeech2 梅尔频谱图作为参考,以缓解去噪步骤产生的伪影。此外,现有模型在音高转换期间可能会受到压缩潜状态上误导信息的影响。我们通过对部分参考梅尔频谱图应用高斯模糊并调整这些区域的损失权重来解决这一问题。广泛的消融研究证明了我们方法的有效性。在中文歌声数据集 OpenCpop 上的评估表明,RDSinger 在性能上优于当前最先进的 SVS 方法。
引用
@article{arxiv.2410.21641,
title = {RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis},
author = {Kehan Sui and Jinxu Xiang and Fang Jin},
journal= {arXiv preprint arXiv:2410.21641},
year = {2024}
}