中文

LLark:面向音乐的多模态指令跟随语言模型

声音 2024-06-04 v3 机器学习 音频与语音处理

摘要

音乐具有独特而复杂的结构,对专家人类与现有AI系统均具理解难度,并相对其他音频形式提出独特挑战。我们提出LLark,一种面向\emph{音乐}理解的指令微调多模态模型。我们详述了数据集创建流程,包括增强多样化开源音乐数据集的标注并将其转换为统一的指令微调格式。我们为LLark提出一种多模态架构,将预训练音乐生成模型与预训练语言模型相集成。在三类任务(音乐理解、字幕生成、推理)的评估中,我们显示LLark在音乐理解上匹配或超越现有基线,且人类在其字幕生成与推理任务响应上表现出高度一致性。LLark完全基于开源音乐数据与模型训练,我们随本文发布公开训练代码。更多结果与音频示例见 https://bit.ly/llark,源代码见 https://github.com/spotify-research/llark。

关键词

引用

@article{arxiv.2310.07160,
  title  = {LLark: A Multimodal Instruction-Following Language Model for Music},
  author = {Josh Gardner and Simon Durand and Daniel Stoller and Rachel M. Bittner},
  journal= {arXiv preprint arXiv:2310.07160},
  year   = {2024}
}

备注

ICML camera-ready version