符号音乐生成的高效长序列扩散建模
声音
2026-03-03 v1 人工智能
摘要
符号音乐生成是多媒体生成中的一个具有挑战性的任务,涉及具有层次化时间结构、长程依赖和细粒度局部细节的长序列。尽管最近的扩散模型产生高质量的生成结果,但由于迭代去噪和与序列长度相关的成本,它们在长符号序列上往往 suffer 高训练和推理成本。为解决这一问题,我们提出了一种称为 SMDIM 的扩散策略,将高效全局结构构建与轻量局部细化相结合。SMDIM 使用结构化状态空间模型以近线性成本捕获音乐的长程上下文,并通过混合细化方案有选择地细化局部音乐细节。实验在涵盖各种西方古典音乐、流行音乐和传统民歌音乐的广泛符号音乐数据集上进行,表明 SMDIM 模型在生成质量和计算效率方面均优于其他最先进的方法,并且对未探索的音乐风格具有稳健的泛化能力。这些结果表明,SMDIM 为长序列符号音乐生成提供了一种原则性解决方案,包括伴随序列的相关属性。我们提供了一个项目网页,包含音频示例和补充材料,链接为 https://3328702107.github.io/smdim-music/。
引用
@article{arxiv.2603.00576,
title = {Efficient Long-Sequence Diffusion Modeling for Symbolic Music Generation},
author = {Jinhan Xu and Xing Tang and Houpeng Yang and Haoran Zhang and Shenghua Yuan and Jiatao Chen and Tianming Xi and Jing Wang and Jiaojiao Yu and Guangli Xiang},
journal= {arXiv preprint arXiv:2603.00576},
year = {2026}
}
备注
17 pages, 5 figures