中文

基于图扩散和层次音乐分析的结构化音乐生成框架——ProGress

声音 2025-10-14 v1 机器学习 音频与语音处理

摘要

人工智能音乐生成正经历快速发展,近期符号化模型利用了相当 sophisticated 的深度学习和扩散模型算法。现有模型的一个缺点是缺乏结构性一致性,尤其是在和声-旋律结构方面。此外,这些模型大多是“黑箱”式的,缺乏音乐可解释性。本文通过一种新型生成音乐框架来克服这些限制,该框架结合了斯克耳纳分析(SchA)概念与扩散建模框架。我们称之为 ProGress(Prolongation-enhanced DiGress),该框架针对音乐生成对 DiGress 模型(Vignac 等,2023)进行了创新性改造,以实现可解释且具有结构性的音乐生成。具体而言,我们的贡献包括 1)对 DiGress 模型进行音乐生成的新型改造,2)一种新颖的 SchA 启发的短语融合方法,以及 3)一个允许用户控制生成过程各个方面,以创建连贯音乐作品的框架。人类实验结果表明,我们的方法在性能上优于现有最先进方法。

关键词

引用

@article{arxiv.2510.10249,
  title  = {ProGress: Structured Music Generation via Graph Diffusion and Hierarchical Music Analysis},
  author = {Stephen Ni-Hahn and Chao Péter Yang and Mingchen Ma and Cynthia Rudin and Simon Mak and Yue Jiang},
  journal= {arXiv preprint arXiv:2510.10249},
  year   = {2025}
}