中文

基于状态空间建模的高训练效率文本到音乐生成

声音 2026-01-22 v1 人工智能

摘要

文本到音乐生成(TTM)领域的最新进展已产生高质量的结果,但往往以大量计算资源和使用大型专有内部数据为代价。为提高 TTM 训练的经济性与开放性,需要一个训练和数据效率更高的开源生成模型骨干。本文将生成模型中可训练参数的数量限制为与 MusicGen-small 基准相当(约 300M 参数),并用新兴的状态空间模型(SSM)替换其 Transformer 骨干。具体而言,我们探索了用于序列建模的不同 SSM 变体,并比较了单阶段基于 SSM 的设计与可分解的两阶段 SSM/扩散混合设计。所有提出的模型均在包含 457 小时 CC 许可音乐的纯公开数据集上从头训练,确保完全开放。我们的实验结果有三方面。首先,我们表明 SSM 与 Transformer 相比展现出更优的训练效率。其次,尽管与 MusicGen-small 基准相比仅使用了 9% 的 FLOPs 和 2% 的训练数据规模,我们的模型在基于 MusicCaps 描述的客观指标和主观听觉测试中均取得了具有竞争力的性能。最后,我们的缩减实验表明,当模型大小缩小至四分之一时,在相同的训练预算(以迭代次数衡量)下,SSM 相对于 Transformer 基线仍能保持有竞争力的性能。为促进 TTM 研究的民主化,处理后的描述、模型检查点和源代码已通过项目页面在 GitHub 上公开:https://lonian6.github.io/ssmttm/。

关键词

引用

@article{arxiv.2601.14786,
  title  = {Training-Efficient Text-to-Music Generation with State-Space Modeling},
  author = {Wei-Jaw Lee and Fang-Chih Hsieh and Xuanjun Chen and Fang-Duo Tsai and Yi-Hsuan Yang},
  journal= {arXiv preprint arXiv:2601.14786},
  year   = {2026}
}

备注

9 pages, 3 figures. This is a preprint of a paper submitted to IEEE/ACM TASLP