M$^{2}$UGen:借助大语言模型能力的多模态音乐理解与生成
声音
2024-12-10 v5 多媒体
音频与语音处理
摘要
当前利用大语言模型(LLMs)的研究图景正经历激增。许多工作借助这些模型强大的推理能力来理解文本、语音、图像、视频等多种模态,并利用LLMs理解人类意图并生成图像、视频、音乐等期望输出。然而,结合LLMs的理解与生成的研究仍有限且处于起步阶段。为弥补这一缺口,我们提出了一种多模态音乐理解与生成(MUGen)框架,该框架融合了LLM理解和生成不同模态音乐的能力。MUGen框架专为从音乐、图像和视频等多样灵感来源释放创作潜力而构建,分别使用预训练的MERT、ViT和ViViT模型实现。为实现音乐生成,我们探索了AudioLDM 2与MusicGen的使用。多模态理解与音乐生成的桥接通过集成LLaMA 2模型完成。此外,我们利用MU-LLaMA模型生成支持文本/图像/视频到音乐生成的广泛数据集,以训练我们的MUGen框架。我们对所提框架进行了全面评估。实验结果表明,我们的模型达到或超越了当前最先进(SOTA)模型的性能。
引用
@article{arxiv.2311.11255,
title = {M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models},
author = {Shansong Liu and Atin Sakkeer Hussain and Qilong Wu and Chenshuo Sun and Ying Shan},
journal= {arXiv preprint arXiv:2311.11255},
year = {2024}
}