中文

PhraseVAE与PhraseLDM:用于全曲多轨符号音乐生成的潜扩散

声音 2025-12-17 v2

摘要

本技术报告提出了一种全曲符号音乐生成的新范式。现有符号模型基于音符属性标记操作,面临序列极长、上下文长度有限以及对长程结构支持薄弱等问题。我们通过引入PhraseVAE和PhraseLDM解决了这些问题,这是首个面向全曲多轨符号音乐的潜扩散框架。PhraseVAE将任意可变长度的多声部音符序列压缩为单个紧凑的64维乐句级潜表示,具有高重建保真度,从而形成结构良好的潜空间和高效的生成建模。基于该潜空间,PhraseLDM在单次前向传播中生成整首多轨歌曲,无需任何自回归组件。该系统消除了小节级序贯建模,支持最多128小节音乐(64bpm下8分钟),并生成具有连贯局部纹理、惯用乐器模式和清晰全局结构的完整歌曲。仅需45M参数,我们的框架可在数秒内生成全曲,同时保持具有竞争力的音乐质量和生成多样性。这些结果共同表明,乐句级潜扩散为符号音乐生成中的长序列建模提供了有效且可扩展的解决方案。我们希望这项工作能鼓励未来的符号音乐研究超越音符属性标记,考虑乐句级单元作为更有效且更具音乐意义的建模目标。

关键词

引用

@article{arxiv.2512.11348,
  title  = {PhraseVAE and PhraseLDM: Latent Diffusion for Full-Song Multitrack Symbolic Music Generation},
  author = {Longshen Ou and Ye Wang},
  journal= {arXiv preprint arXiv:2512.11348},
  year   = {2025}
}