中文

MuseBarControl:通过预训练和反事实损失提升符号音乐生成中的细粒度控制

声音 2024-07-08 v1 人工智能 音频与语音处理

摘要

自动为特定人类需求生成量身定制的符号音乐——即音乐记谱分数——对于音乐家和爱好者具有极大益处。最近的研究表明,使用大规模数据集和先进的转换器架构可实现令人振奋的效果。然而,这些最先进的模型通常仅能对整个作品的节拍和风格等方面进行基本控制,缺乏对诸如 individual bar 级别控制等细节方面的管理能力。虽然对预训练的符号音乐生成模型进行微调似乎是实现更细粒度控制的直接方法,但我们的研究表明,这种方法存在挑战。模型往往无法对新的细粒度 bar 级控制信号作出 adequate 响应。为此,我们提出了两种创新解决方案。首先,我们引入一种旨在将控制信号直接链接到相应音符的预训练任务,这有助于实现更有效的后续微调初始化。其次,我们实现一种新型反事实损失,以促进生成的音乐与控制提示之间的更好对齐。通过这些技术,我们显著增强了对音乐生成进行 bar 级别控制的能力,相较于常规方法实现了 13.06% 的改进。我们的主观评估也确认,这种增强的控制并未损害原始预训练生成模型的音乐质量。

关键词

引用

@article{arxiv.2407.04331,
  title  = {MuseBarControl: Enhancing Fine-Grained Control in Symbolic Music Generation through Pre-Training and Counterfactual Loss},
  author = {Yangyang Shu and Haiming Xu and Ziqin Zhou and Anton van den Hengel and Lingqiao Liu},
  journal= {arXiv preprint arXiv:2407.04331},
  year   = {2024}
}

备注

Demo is available at: https://ganperf.github.io/musebarcontrol.github.io/musebarcontrol/