中文

NOTA:面向视觉大语言模型的多模态音乐记谱理解

计算机视觉与模式识别 2025-02-24 v1 人工智能 机器学习 声音 音频与语音处理

摘要

符号音乐以两种不同形式呈现:二维、直观的记谱图像和一维、标准化的文本注释序列。虽然大语言模型在音乐领域展现了惊人的潜力,但当前研究主要聚焦于单模态符号序列文本。现有的通用领域视觉语言模型仍缺乏音乐记谱理解能力。为填补这一空白,我们提出NOTA,首个大规模全方位多模态音乐记谱数据集。数据集包含1,019,237条记录,来自全球三个地区,包含3项任务。基于该数据集,我们训练了NotaGPT,一款音乐记谱视觉大语言模型。具体而言,我们引入预对齐训练阶段,以实现音乐记谱图像中音符与其文本表示(ABC记谱)之间的跨模态对齐。后续训练阶段聚焦音乐信息提取,再进行音乐记谱分析训练。实验结果表明,NotaGPT-7B在音乐理解方面实现显著提升,展示了NOTA数据集和训练管道的有效性。我们的数据集已开源于 https://huggingface.co/datasets/MYTH-Lab/NOTA-dataset。

关键词

引用

@article{arxiv.2502.14893,
  title  = {NOTA: Multimodal Music Notation Understanding for Visual Large Language Model},
  author = {Mingni Tang and Jiajia Li and Lu Yang and Zhiqiang Zhang and Jinghao Tian and Zuchao Li and Lefei Zhang and Ping Wang},
  journal= {arXiv preprint arXiv:2502.14893},
  year   = {2025}
}