基于内容的音乐大语言建模控制
人工智能
2024-10-08 v3 声音
音频与语音处理
摘要
近年来,音乐音频领域的大规模语言模型快速增长。此类模型支持端到端生成更高质量的音乐,部分允许使用文本描述进行条件生成。然而,文本控制对音乐的控制力本质上有限,因为它们只能通过元数据(如歌手和乐器)或高层表示(如流派和情感)间接描述音乐。我们旨在进一步为模型配备针对音高、和弦和鼓轨等内在音乐语言的直击式、基于内容的控制。为此,我们提出Coco-Mulla,一种用于音乐大语言建模的基于内容的控制方法。它采用专为基于Transformer的音频模型设计的参数高效微调(PEFT)方法。实验表明,我们的方法以低资源半监督学习实现了高质量音乐生成,相较于原始模型仅微调少于4%的参数,并在少于300首歌曲的小数据集上训练。此外,我们的方法支持有效的基于内容的控制,并通过和弦与节奏这两种最显著的音乐音频特征展示了控制力。进一步,我们表明通过结合基于内容的控制与文本描述,我们的系统实现了灵活的音乐变体生成与编曲。我们的源代码与演示已在线提供。
引用
@article{arxiv.2310.17162,
title = {Content-based Controls For Music Large Language Modeling},
author = {Liwei Lin and Gus Xia and Junyan Jiang and Yixiao Zhang},
journal= {arXiv preprint arXiv:2310.17162},
year = {2024}
}