GaMMA:大型多模态模型中的联合全局-时序音乐理解
声音
2026-05-04 v1 人工智能
摘要
本文提出了 GaMMA,一种面向实现综合音乐内容理解的前沿大型多模态模型 (LMM)。GaMMA 继承了 LLaVA 简洁的编码器-解码器设计,能够在音乐与语言之间实现有效的跨模态学习。通过以 mixture-of-experts 方式融入音频编码器,GaMMA 在一组参数内统一了时序与非时序音乐理解任务。我们的方法结合大规模精心策划的数据集与渐进式训练管道,通过预训练、监督微调 (SFT) 和强化学习 (RL) 有效推进了音乐理解的边界。为全面评估时序与非时序能力,本文引入了 MusicBench,规模最大的音乐导向基准,包含 3,739 个人工精选的多选题,涵盖音乐理解的各个方面。大量实验表明,GaMMA 在音乐领域建立了新的最先进成绩,在 MuchoMusic 上达到 79.1% 的准确率,在 MusicBench-Temporal 上达到 79.3%,在 MusicBench-Global 上达到 81.3%,始终优于先前方法。
引用
@article{arxiv.2605.00371,
title = {GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models},
author = {Zuyao You and Zhesong Yu and Mingyu Liu and Bilei Zhu and Yuan Wan and Zuxuan Wu},
journal= {arXiv preprint arXiv:2605.00371},
year = {2026}
}