低资源音乐生成的适配器设计权衡
声音
2025-08-12 v2 人工智能
计算与语言
机器学习
多媒体
音频与语音处理
摘要
微调大型音乐生成模型(如 MusicGen 和 Mustango)是一项计算成本高昂的过程,通常需要更新数十亿参数,因此需要大量硬件资源。参数高效微调(PEFT)技术,特别是基于适配器的方法,已成为一种有前景的替代方案,使能够在保持模型性能的同时以最小的可训练参数进行适应。然而,适配器的设计选择包括其体系结构、位置和大小等众多选项,尚不清楚哪些组合会产生最佳适配器以及原因,以满足特定低资源音乐流派的需求。本文通过研究 MusicGen 和 Mustango 两种 AI 音乐模型在两大流派(印度古典音乐和土耳其 Makam 音乐)上的各种适配器配置来尝试回答这一问题。我们的发现揭示了不同的权衡:基于卷积的适配器在捕捉细粒度的局部音乐细节(如装饰音和短旋律短语)方面表现出色,而基于转换器的适配器更能保留对结构化即兴演奏至关重要的长程依赖。此外,我们分析了不同适配器规模下的计算资源需求,展示了中等规模适配器(40M 参数)在表达性和质量之间实现了最佳平衡。我们还发现 Mustango——一种基于扩散模型的模型——生成更具多样性的输出,能够更好地遵循输入提示中的描述,但在提供音符稳定性、节奏对齐和审美方面存在不足。而且它计算密集,训练时间显著更长。相比之下,基于自回归模型的 MusicGen 训练更快且更高效,并且能够产生更好的质量输出,但在生成中存在略高的冗余。
引用
@article{arxiv.2506.21298,
title = {Exploring Adapter Design Tradeoffs for Low Resource Music Generation},
author = {Atharva Mehta and Shivam Chauhan and Monojit Choudhury},
journal= {arXiv preprint arXiv:2506.21298},
year = {2025}
}
备注
9 pages, 4 figures