Amadeus:面向符号音乐的具有双向属性建模的自回归模型
声音
2025-08-29 v1 人工智能
多媒体
摘要
现有的最先进符号音乐生成模型主要采用自回归或分层自回归架构,在假定这些属性之间存在固定且严格的依赖结构的前提下,将符号音乐建模为具有单向时间依赖性的属性 token 序列。然而,我们观察到,在这些模型中使用不同属性作为初始 token 会产生相当的性能。这表明,音符的属性本质上是一个并发且无序的集合,而非具有时间依赖性的序列。基于这一洞察,我们引入了 Amadeus,一种新颖的符号音乐生成框架。Amadeus 采用双层架构:用于音符序列的自回归模型和用于属性的双向离散扩散模型。为提升性能,我们提出了音乐潜在空间可判别性增强策略,该策略引入对比学习约束,以增强中间音乐表示的可判别性。条件信息增强模块同时通过注意力机制增强音符潜在向量表示,从而实现更精确的音符解码。我们在无条件生成和文本条件生成任务上进行了广泛实验。Amadeus 在多项指标上显著优于 SOTA 模型,同时实现了至少 4 倍的加速。此外,我们展示了使用我们的模型实现无需训练的细粒度音符属性控制的可行性。为探索 Amadeus 架构的性能上限,我们编制了迄今为止最大的开源符号音乐数据集 AMD(Amadeus MIDI Dataset),支持预训练和微调。
引用
@article{arxiv.2508.20665,
title = {Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music},
author = {Hongju Su and Ke Li and Lan Yang and Honggang Zhang and Yi-Zhe Song},
journal= {arXiv preprint arXiv:2508.20665},
year = {2025}
}
备注
Under review