旋律引导的音乐生成
声音
2024-12-31 v4 人工智能
音频与语音处理
摘要
我们提出了 Melody-Guided Music Generation(MG2) 模型,这是一种利用旋律引导文本到音乐生成的方法。该方法简单且资源有限,但实现了卓越的性能。具体而言,我们首先通过新提出的 Contrastive Language-Music Pretraining 方法将文本与音频波形及其关联旋律对齐,从而实现将学习到的文本表示与隐式旋律信息融合。随后,我们将检索增强扩散模块置于文本提示和检索到的旋律上进行条件化。这使得 MG2 能够生成符合给定文本描述内容的音乐,同时在显式旋律信息的指导下保持内在和谐。我们在两个公开数据集上进行了广泛实验:MusicCaps 和 MusicBench。意外的是,实验结果显示,我们提出的 MG2 模型在参数数量少于当前开源文本到音乐生成模型的 1/3 或训练数据的不到 1/200 的情况下,便超越了现有的 SOTA 模型。此外,我们针对 MG2 的潜在实际应用,conducted 了全面的人类评估,包括三类用户和五个观察维度,并设计了新的问卷。
引用
@article{arxiv.2409.20196,
title = {Melody-Guided Music Generation},
author = {Shaopeng Wei and Manzhen Wei and Haoyu Wang and Yu Zhao and Gang Kou},
journal= {arXiv preprint arXiv:2409.20196},
year = {2024}
}
备注
16 pages, 8 figure, 8 tables