中文

面向基于扩散模型的符号音乐生成的高效细粒度指导

声音 2025-06-09 v3 人工智能 机器学习 多媒体 音频与语音处理

摘要

开发生成模型来创建或条件化创建符号音乐由于数据稀缺性以及对音符音高高度精确度的需求,具有独特挑战。为此,我们在扩散模型中引入一种高效细粒度指导(FGG)方法。FGG 指导扩散模型生成更贴近专家作曲家控制意图的音乐,这对于提高生成音乐的准确性、可听性和质量至关重要。该方法使扩散模型在诸如即兴创作和交互式音乐创作等高级应用中大放异彩。我们对符号音乐生成中的挑战以及 FGG 方法的影响进行了理论表征。我们提供了数值实验和主观评估,以展示该方法的有效性。我们已发布演示页面以展示演出效果,实现了实时交互式生成。

关键词

引用

@article{arxiv.2410.08435,
  title  = {Efficient Fine-Grained Guidance for Diffusion Model Based Symbolic Music Generation},
  author = {Tingyu Zhu and Haoyu Liu and Ziyu Wang and Zhimin Jiang and Zeyu Zheng},
  journal= {arXiv preprint arXiv:2410.08435},
  year   = {2025}
}