中文

MusicMagus:基于扩散模型的零样本文本到音乐编辑

声音 2024-05-29 v3 人工智能 多媒体 音频与语音处理

摘要

文本到音乐生成模型的最新进展为音乐创作开辟了新途径。然而,音乐生成通常涉及迭代细化,如何编辑生成的音乐仍然是一个重大挑战。本文介绍了一种针对此类模型生成音乐进行编辑的新方法,能够在保持其他方面不变的同时,修改特定属性,如流派、情绪和乐器。我们的方法将文本编辑转化为潜空间操作,同时添加额外的约束以保持一致性。它与现有的预训练文本到音乐扩散模型无缝集成,无需额外训练。实验结果表明,在风格和音色迁移评估中,其性能优于零样本和某些有监督基线。此外,我们展示了该方法在真实世界音乐编辑场景中的实际适用性。

关键词

引用

@article{arxiv.2402.06178,
  title  = {MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models},
  author = {Yixiao Zhang and Yukara Ikemiya and Gus Xia and Naoki Murata and Marco A. Martínez-Ramírez and Wei-Hsiang Liao and Yuki Mitsufuji and Simon Dixon},
  journal= {arXiv preprint arXiv:2402.06178},
  year   = {2024}
}

备注

Accepted to IJCAI 2024