中文

MusiXQA:推动多模态大语言模型中的视觉音乐理解

计算机视觉与模式识别 2025-08-15 v3

摘要

多模态大语言模型(MLLMs)在自然图像、文本丰富的文档和图形设计中已实现显著的视觉推理能力,但其理解音乐谱面的能力仍受到 insufficient 的探索。为弥合这一差距,我们引入 MusiXQA,这是第一个为评估和推动 MLLMs 在音乐谱面理解方面而建立的全面数据集。MusiXQA 包含通过 MusiXTeX 生成的高质量合成音乐谱,涵盖音符音高与时长、和弦、谱号、键号/时间签名以及文本等结构化标注,支持多样化的视觉问答任务。通过大规模评估,我们揭示了当前最先进 MLLMs 在该领域存在显著局限。除基准测试外,我们开发了 Phi-3-MusiX,一款在本数据集上微调的 MLLM,相较于基于 GPT 的方法实现了显著性能提升。该提出的数据集和模型为未来在 MLLMs 音乐谱面理解方面的进展奠定了基础。代码、数据和模型将在接受后发布。

关键词

引用

@article{arxiv.2506.23009,
  title  = {MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models},
  author = {Jian Chen and Wenye Ma and Penghang Liu and Wei Wang and Tengwei Song and Ming Li and Chenguang Wang and Jiayu Qin and Ruiyi Zhang and Changyou Chen},
  journal= {arXiv preprint arXiv:2506.23009},
  year   = {2025}
}

备注

Under Review