深度结构化音乐复现:预算受限的递归注意力用于完整作品符号化音乐建模
声音
2026-03-03 v2 人工智能
机器学习
摘要
长时序建模是符号化音乐生成的关键要素,因为动机的重复与演绎变形可跨越数千个音乐事件,而实际工作流程常依赖资源受限的硬件。我们提出深度结构化音乐复现 (Depth-Structured Music Recurrence, DSMR),这是一种训练时设计,能够通过从左到右流式传输每件作品并采用具有状态的递归注意力机制,在固定的递归状态预算下分配各层的记忆时程来实现端到端学习完整作品。我们的主要实现版本为双尺度 DSMR,为底层层分配较长的历史窗口,而为其余层分配统一的短窗口。在 MAESTRO 钢琴演奏数据集上,双尺度 DSMR 在困惑度 (perplexity) 上与完整记忆递归参考相当(5.96 与 5.98),同时使用约 59% 更少的 GPU 内存,吞吐量提升约 36%。变体分析进一步表明,在二元时程预算下,层级可互换性很强:性能主要取决于总体分配的内存数目,而非特定层承载其内存。
关键词
引用
@article{arxiv.2602.19816,
title = {Depth-Structured Music Recurrence: Budgeted Recurrent Attention for Full-Piece Symbolic Music Modeling},
author = {Yungang Yi and Weihua Li and Matthew Kuo and Catherine Shi and Quan Bai},
journal= {arXiv preprint arXiv:2602.19816},
year = {2026}
}