音乐一致性模型
声音
2024-04-23 v1 人工智能
音频与语音处理
摘要
一致性模型在促进高效图像/视频生成方面展现了卓越的能力,使合成过程能够通过最小采样步骤实现。它在缓解扩散模型所致的计算负担方面具有显优势。然而,一致性模型在音乐生成领域的应用仍鲜有探索。为填补这一空白,我们提出了音乐一致性模型(MusicCM),利用一致性模型的概念高效合成音乐片段的梯谱图,同时保持高质量并最小化采样步骤。基于现有的文本到音乐扩散模型,MusicCM模型融合了一致性蒸馏和对抗判别器训练。此外,我们发现通过纳入多个具有共享约束的扩散过程以生成扩展且连贯的音乐是有益的。实验结果表明,该模型在计算效率、保真度和自然度方面均表现出色。值得注意的是,MusicCM仅需四个采样步骤即可实现无缝音乐合成,例如每分钟音频仅需一秒,展示了其在实时应用方面的潜力。
引用
@article{arxiv.2404.13358,
title = {Music Consistency Models},
author = {Zhengcong Fei and Mingyuan Fan and Junshi Huang},
journal= {arXiv preprint arXiv:2404.13358},
year = {2024}
}