编排、修复与精修:基于内容控制的可控长期音乐音频生成与编辑
声音
2024-10-08 v3 人工智能
音频与语音处理
摘要
可控的音乐生成在人机协同音乐创作中起着至关重要的作用。尽管大语言模型(LLM)在生成高质量音乐方面展现出了潜力,但其专注于自回归生成的方式限制了其在音乐编辑任务中的实用性。为了弥补这一不足,我们提出了一种新颖的方法,利用参数高效的异构适配器结合掩码训练方案。该方法使自回归语言模型能够无缝地处理音乐修复任务。此外,我们的方法还集成了帧级基于内容的控制,从而便于实现以音轨为条件的音乐精修以及以乐谱为条件的音乐编排。我们将该方法应用于对领先的自回归音乐生成模型 MusicGen 的微调。实验结果表明,我们的方法在多种音乐编辑任务上取得了令人满意的效果,为未来人工智能驱动的音乐编辑工具提供了更灵活的控制手段。源代码及展示我们工作的演示页面可在 https://kiko-16.github.io/AIR 获取。
引用
@article{arxiv.2402.09508,
title = {Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls},
author = {Liwei Lin and Gus Xia and Yixiao Zhang and Junyan Jiang},
journal= {arXiv preprint arXiv:2402.09508},
year = {2024}
}