中文

MuMu-LLaMA:基于大语言模型的多模态音乐理解与生成

声音 2024-12-10 v1 多媒体 音频与语音处理

摘要

大语言模型的研究在文本、语音、图像和视频等方面取得了显著进展。然而,由于缺乏充分标注的数据集,多模态音乐理解与生成仍得到较少探索。为此,我们引入了一个包含 167.69 小时多模态数据的集合,涵盖文本、图像、视频和音乐标注。基于该数据集,我们提出了 MuMu-LLaMA 模型,利用预训练的音乐、图像和视频编码器。对于音乐生成,我们集成了 AudioLDM 2 和 MusicGen。我们的评估覆盖四个任务——音乐理解、文本到音乐生成、基于提示的音乐编辑和多模态音乐生成——表明 MuMu-LLaMA 在多个任务上超越了当前最先进的模型,展示了其在多模态音乐应用中的潜力。

关键词

引用

@article{arxiv.2412.06660,
  title  = {MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models},
  author = {Shansong Liu and Atin Sakkeer Hussain and Qilong Wu and Chenshuo Sun and Ying Shan},
  journal= {arXiv preprint arXiv:2412.06660},
  year   = {2024}
}