中文

利用递归特征机引导自回归音乐生成

机器学习 2026-04-06 v2 人工智能 声音 音频与语音处理

摘要

可控音乐生成仍是一个重要挑战,现有方法往往需要模型重新训练或引入可听见的伪影。我们引入 MusicRFM 框架,将递归特征机(RFM)适用于冻结、预训练的音乐模型,以实现对模型内部激活的细粒度、可解释控制。RFM 通过分析模型的内部梯度,生成可解释的“概念方向”,即激活空间中对应音乐属性(如音符或和弦)的特定轴。我们首先训练轻量级 RFM 探针,在 MusicGen 的隐藏状态中发现这些方向;随后在推理阶段,将其注入模型以实时引导生成过程,而无需逐步优化。我们提供了这种控制的高级机制,包括动态时变计划和多音乐属性同时实现的方法。我们的方法成功地在控制与生成质量之间找到了平衡:将生成目标音符的准确率从 0.23 提升到 0.82,而文本提示遵循度保持在约 0.02 的无驾驶基准水平内,表明在保持提示忠诚度的同时实现了有效控制。我们发布代码,以鼓励在音乐领域进一步探索 RFM 的应用。

关键词

引用

@article{arxiv.2510.19127,
  title  = {Steering Autoregressive Music Generation with Recursive Feature Machines},
  author = {Daniel Zhao and Daniel Beaglehole and Taylor Berg-Kirkpatrick and Julian McAuley and Zachary Novack},
  journal= {arXiv preprint arXiv:2510.19127},
  year   = {2026}
}