MuseControlLite:轻量化可控音乐生成
声音
2025-06-25 v2 人工智能
音频与语音处理
摘要
我们提出了MuseControlLite,一种旨在使用各种时间变化的音乐属性和参考音频信号对文本到音乐生成模型进行精确条件控制的轻量化机制。关键发现是,位置嵌入(在文本到音乐生成模型的条件器中很少使用)对于条件是时间函数的情况至关重要。以旋律控制为例,我们的实验表明,仅仅将旋转位置嵌入添加到解耦的交叉注意力层中即可将控制准确率从56.6%提高到61.1%,而只需状态-of-the-art 微调机制的6.75倍参数,同时使用与 Stable Audio Open 相同的预训练扩散 Transformer 模型。我们评估了各种形式的音乐属性控制、音频 inpainting 和音频 outpainting,展示了在显著降低微调成本的情况下,对 MusicGen-Large 和 Stable Audio Open ControlNet 的可控性显著提升,仅需85M可训练参数。源码、模型检查点和演示示例均可在 https://musecontrollite.github.io/web/ 获取。
引用
@article{arxiv.2506.18729,
title = {MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners},
author = {Fang-Duo Tsai and Shih-Lun Wu and Weijaw Lee and Sheng-Ping Yang and Bo-Rui Chen and Hao-Chung Cheng and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2506.18729},
year = {2025}
}
备注
Accepted by the 42nd International Conference on Machine Learning (ICML 2025)