InstructME:基于隐扩散模型的指令引导音乐编辑与混音框架
声音
2023-12-13 v3 人工智能
音频与语音处理
摘要
音乐编辑主要包括对乐器音轨的修改或整体的重新混音,通过一系列操作对原作品进行新颖的重新诠释。这些音乐处理方法在各种应用中具有巨大潜力,但需要大量专业知识。先前的方法虽然对图像和音频修改有效,但直接应用于音乐时表现不佳。这归因于音乐独特的数据特性,此类方法可能无意中破坏音乐内在的和谐与连贯性。本文中,我们开发了 InstructME,一个基于隐扩散模型的指令引导音乐编辑与混音框架。我们的框架通过多尺度聚合增强 U-Net,以维持编辑前后的一致性。此外,我们引入和弦进行矩阵作为条件信息,并将其融入语义空间,以在编辑时改善旋律和谐度。为适应较长的音乐片段,InstructME 采用块变换器(chunk transformer),使其能够识别音乐序列中的长期时间依赖关系。我们在乐器编辑、混音和多轮编辑中测试了 InstructME。主观和客观评估均表明,我们提出的方法在音乐质量、文本相关性和和谐度上显著超越先前系统。演示样本可在 https://musicedit.github.io/ 获取。
引用
@article{arxiv.2308.14360,
title = {InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models},
author = {Bing Han and Junyu Dai and Weituo Hao and Xinyan He and Dong Guo and Jitong Chen and Yuxuan Wang and Yanmin Qian and Xuchen Song},
journal= {arXiv preprint arXiv:2308.14360},
year = {2023}
}
备注
Demo samples are available at https://musicedit.github.io/