中文

基于潜在扩散模型的减法训练用于音乐干挑声插入

声音 2025-01-22 v2 机器学习 音频与语音处理

摘要

我们提出了一种名为Subtractive Training的简单且新颖的方法,用于给定其他乐器作为上下文合成单个音乐乐器干挤声。该方法将包含完整音乐混合合集与1)缺失特定乐器声道的该合集变体,以及2)由LLM生成描述如何重新引入缺失乐器的指令,配对。我们随后对预训练的文本到音频扩散模型进行微调,利用现有乐器声道和文本指令生成缺失的乐器声道。我们的实验表明,Subtractive Training在创建与现有轨道无缝融合的逼真鼓组声道方面具有有效性。我们还展示了可利用文本指令控制插入声道的节奏、力度和类型,从而在保持其他乐器不变的同时修改整首歌中单一乐器的风格。最后,我们将该技术扩展至MIDI格式,成功生成兼容的低音、鼓组和吉他伴奏,用于不完整的编排。

关键词

引用

@article{arxiv.2406.19328,
  title  = {Subtractive Training for Music Stem Insertion using Latent Diffusion Models},
  author = {Ivan Villa-Renteria and Mason L. Wang and Zachary Shah and Zhe Li and Soohyun Kim and Neelesh Ramachandran and Mert Pilanci},
  journal= {arXiv preprint arXiv:2406.19328},
  year   = {2025}
}

备注

5 pages, survey, edit pipeline figure, fix typos