中文

Instruct-MusicGen:通过指令微调解锁文本到音乐编辑,为音乐语言模型提供解决方案

声音 2025-07-21 v3 人工智能 机器学习 多媒体 音频与语音处理

摘要

最近的文本到音乐编辑技术进展,利用文本查询来修改音乐(例如通过更改其风格或调整乐器组件),为 AI 辅助音乐创作带来了独特的挑战和机遇。先前在该领域的方法受到了限制,必须从头训练特定的编辑模型,这既资源密集又效率低下;另一些研究使用大型语言模型来预测编辑后的音乐,导致音频重建不够精确。为整合优势并解决这些限制,我们引入了 Instruct-MusicGen,这是一种新方法,通过微调预训练的 MusicGen 模型来高效遵循编辑指令,如添加、删除或分离声部。我们的方法通过引入文本融合模块和音频融合模块来修改原始 MusicGen 架构,这允许模型同时处理指令文本和音频输入,从而生成所需的编辑后音乐。值得注意的是,Instruct-MusicGen仅引入了8%的新参数,并且仅训练了5K步,却在所有任务上均优于现有基线,并在性能上与为特定任务训练的模型相当。这一进展不仅增强了文本到音乐编辑的效率,也拓宽了音乐语言模型在动态音乐制作环境中的应用范围。

关键词

引用

@article{arxiv.2405.18386,
  title  = {Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning},
  author = {Yixiao Zhang and Yukara Ikemiya and Woosung Choi and Naoki Murata and Marco A. Martínez-Ramírez and Liwei Lin and Gus Xia and Wei-Hsiang Liao and Yuki Mitsufuji and Simon Dixon},
  journal= {arXiv preprint arXiv:2405.18386},
  year   = {2025}
}

备注

Accepted at ISMIR 2025 Conference. Code and demo are available at: https://github.com/ldzhangyx/instruct-musicgen