中文

DeepResonance:通过以音乐为中心的多向指令调优提升多模态音乐理解

声音 2025-09-24 v3 人工智能 计算与语言 多媒体 音频与语音处理

摘要

近期音乐大型语言模型(LLM)的快速发展显著提升了音乐理解任务的性能, 这些任务涉及模型分析和解释各种音乐元素的能力。这些改进主要侧重于集成音乐和文本输入。然而, 探索将额外模态(如图像、视频和文本音乐特征)纳入以增强音乐理解的潜力尚未得到探索。为填补这一差距, 我们提出DeepResonance, 一种通过多向指令调优微调的多模态音乐理解 LLM, 其融合多模态对齐的音乐、文本、图像和视频数据。为此, 我们构建了Music4way-MI2T, Music4way-MV2T 和 Music4way-Any2T 三个设计以使DeepResonance能够集成视觉和文本音乐特征内容的4向训练和评估数据集。我们还引入多采样的 ImageBind 嵌入和面向多向指令调优的预-LLM 融合 Transformer。我们的模型在六个音乐理解任务中实现了最先进的性能, 突显了辅助模态的优势以及DeepResonance的结构优越性。我们开源了构建的代码、模型和数据集: github.com/sony/DeepResonance。

关键词

引用

@article{arxiv.2502.12623,
  title  = {DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning},
  author = {Zhuoyuan Mao and Mengjie Zhao and Qiyu Wu and Hiromi Wakaki and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2502.12623},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 main conference