中文

基于非可微规则引导扩散的符号音乐生成

声音 2024-09-26 v4 机器学习 音频与语音处理

摘要

我们研究符号音乐生成(例如,生成钢琴卷帘)问题,技术重点是非可微规则引导。音乐规则通常以符号形式表达音符特征,如音符密度或和弦进行,其中许多规则是不可微的,这给将其用于引导扩散带来了挑战。我们提出了随机控制引导(SCG),一种新颖的引导方法,仅需对规则函数进行前向评估,可以以即插即用的方式与预训练扩散模型配合使用,从而首次实现了非可微规则的无训练引导。此外,我们引入了一种用于符号音乐生成的潜在扩散架构,具有高时间分辨率,可以与SCG以即插即用的方式组合。与符号音乐生成中的标准强基线相比,该框架在音乐质量和基于规则的可控性方面表现出显著进步,在各种设置中优于当前最先进的生成器。有关详细演示、代码和模型检查点,请访问我们的项目网站:https://scg-rule-guided-music.github.io/。

关键词

引用

@article{arxiv.2402.14285,
  title  = {Symbolic Music Generation with Non-Differentiable Rule Guided Diffusion},
  author = {Yujia Huang and Adishree Ghatare and Yuanzhe Liu and Ziniu Hu and Qinsheng Zhang and Chandramouli S Sastry and Siddharth Gururani and Sageev Oore and Yisong Yue},
  journal= {arXiv preprint arXiv:2402.14285},
  year   = {2024}
}

备注

ICML 2024 (Oral)