Mustango:迈向可控的文本到音乐生成
音频与语音处理
2025-06-18 v3
摘要
由于扩散模型近期的进展,文本到音乐模型的质量已达到新的高度。然而,对各类音乐方面的可控性几乎未被探索。在本文中,我们提出 Mustango:一个基于扩散的、受音乐领域知识启发的文本到音乐系统。Mustango 旨在控制所生成的音乐,不仅通过通用文本描述,还通过可包含和弦、节拍、速度和调性相关具体指令的更丰富描述。Mustango 的核心是一个音乐领域知识增强的 UNet 引导模块 MuNet,该模块在反向扩散过程中,将生成的音乐引导至包含我们从文本提示中预测出的音乐特定条件以及通用文本嵌入。为克服带文本描述的音乐开放数据集的有限可用性,我们提出一种新颖的数据增强方法,包括改变音乐音频的和声、节奏与动态方面,并使用最先进的音乐信息检索方法提取音乐特征,随后以文本格式附加到现有描述中。我们发布了由此得到的 MusicBench 数据集,其包含超过 52K 个样本,并在描述文本中包含了基于音乐理论的描述。通过大量实验,我们表明 Mustango 生成的音乐质量达到最先进水平,且通过音乐特定文本提示的可控性大幅优于 MusicGen 和 AudioLDM2 等其他模型。
引用
@article{arxiv.2311.08355,
title = {Mustango: Toward Controllable Text-to-Music Generation},
author = {Jan Melechovsky and Zixun Guo and Deepanway Ghosal and Navonil Majumder and Dorien Herremans and Soujanya Poria},
journal= {arXiv preprint arXiv:2311.08355},
year = {2025}
}
备注
NAACL 2024