实时音乐扩散模型:高效微调与后训练的交互式音乐生成器
声音
2026-05-22 v1 人工智能
机器学习
多媒体
摘要
交互式流式音乐生成承诺着眼于不可被离线模型实现的现场演出和协同创作。然而,当前最先进的模型处于离散-AR regime,需要工业级计算进行训练和推理。本文我们探讨了音频扩散模型——它们在开源社区中得到广泛支持,但具有非流式双向性——是否可以高效地转化为可在消费硬件上访问的交互式模型。通过对现代块级 outpainting 扩散管线进行深入审视,我们识别出推理过程中存在关键效率问题,导致其计算效率严重低于离散-AR 模型。我们提出了实时音乐扩散模型(Live Music Diffusion Models, LMDMs),这是一种对生成扩散过程的简单修改,通过块级 KV 缓存恢复并超越离散实时音乐模型(LMMs)的推理复杂度。与 LMMs 不同,LMDMs 进一步支持通过我们新颖的 ARC-Forcing 范式实现稳定的后训练对齐,在无需显式强化学习或奖励模型的情况下降低误差积累。我们展示了 LMDMs 在多个创意领域的应用,包括文本条件生成、草图式音乐合成和即兴演奏。我们最终展示了如何将 LMDMs 用作真实艺术家-AI 协作中的生成乐器,利用 LMDMs 作为“生成延迟”,在消费级游戏笔记本上实时转换音乐家的即兴演奏,以实现可变时序效果。
引用
@article{arxiv.2605.22717,
title = {Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators},
author = {Zachary Novack and Stephen Brade and Haven Kim and Hugo Flores García and Nithya Shikarpur and Chinmay Talegaonkar and Suwan Kim and Valerie K. Chen and Julian McAuley and Taylor Berg-Kirkpatrick and Cheng-Zhi Anna Huang},
journal= {arXiv preprint arXiv:2605.22717},
year = {2026}
}