MusicMagus:基于扩散模型的零样本文本到音乐编辑
声音
2024-05-29 v3 人工智能
多媒体
音频与语音处理
摘要
文本到音乐生成模型的最新进展为音乐创作开辟了新途径。然而,音乐生成通常涉及迭代细化,如何编辑生成的音乐仍然是一个重大挑战。本文介绍了一种针对此类模型生成音乐进行编辑的新方法,能够在保持其他方面不变的同时,修改特定属性,如流派、情绪和乐器。我们的方法将文本编辑转化为潜空间操作,同时添加额外的约束以保持一致性。它与现有的预训练文本到音乐扩散模型无缝集成,无需额外训练。实验结果表明,在风格和音色迁移评估中,其性能优于零样本和某些有监督基线。此外,我们展示了该方法在真实世界音乐编辑场景中的实际适用性。
引用
@article{arxiv.2402.06178,
title = {MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models},
author = {Yixiao Zhang and Yukara Ikemiya and Gus Xia and Naoki Murata and Marco A. Martínez-Ramírez and Wei-Hsiang Liao and Yuki Mitsufuji and Simon Dixon},
journal= {arXiv preprint arXiv:2402.06178},
year = {2024}
}
备注
Accepted to IJCAI 2024