基于扩散模型的结构化状态空间模型符号音乐生成
声音
2026-03-04 v2
摘要
近期扩散模型的进展显著提升了符号化音乐生成能力。然而,大多数方法依赖基于 transformer 的架构,采用自注意力机制,其计算复杂度呈二次方,限制了长序列的可扩展性。为此,我们提出一种名为 SMDIM(Symbolic Music Diffusion with Mamba)的新型扩散架构,集成结构化状态空间模型(SSM)以实现高效的全局上下文建模,并引入 Mamba-FeedForward-Attention 块(MFA)精确保留局部细节。MFA 块结合了 Mamba 层的线性复杂度、FeedForward 层的非线性细化以及自注意力机制的细粒度精度,在可扩展性与音乐表达性之间取得平衡。SMDIM 实现近线性复杂度,高度适用于长序列任务。在多样数据集上进行评估,包括 FolkDB——这是一个代表性的中国传统民乐集合,作为符号音乐生成中较少探索的领域——SMDIM 在生成质量和计算效率方面均优于最先进模型。除了符号音乐,SMDIM 的架构设计也显示出适用于广泛长序列生成任务的潜力,为连贯序列建模提供了高效且可扩展的解决方案。
引用
@article{arxiv.2507.20128,
title = {Diffusion-based Symbolic Music Generation with Structured State Space Models},
author = {Shenghua Yuan and Xing Tang and Jiatao Chen and Tianming Xie and Jing Wang and Bing Shi},
journal= {arXiv preprint arXiv:2507.20128},
year = {2026}
}
备注
This is a duplicate submission. The updated and correct version of this paper is available at arXiv:2603.00576, Efficient Long-Sequence Diffusion Modeling for Symbolic Music Generation. Please disregard this version