MuseAgent-1:乐谱与演奏音频的交互式具身多模态理解
多媒体
2026-01-21 v1 声音
音频与语音处理
摘要
尽管多模态大语言模型(MLLMs)近期取得了进展,但它们理解和与音乐交互的能力仍然有限。音乐理解需要对符号化乐谱和富有表现力的演奏音频进行具身推理,而通用MLLMs由于感知具身性不足,往往无法处理。我们引入了MuseAgent,一个以音乐为中心的多模态智能体,它利用从乐谱图像和演奏音频中提取的结构化符号表示来增强语言模型。通过集成光学音乐识别和自动音乐转录模块,MuseAgent能够对细粒度音乐内容进行多步推理和交互。为了系统地评估音乐理解能力,我们进一步提出了MuseBench,一个涵盖文本、图像和音频模态的音乐理论推理、乐谱解读和演奏级分析的基准。实验表明,现有MLLMs在这些任务上表现不佳,而MuseAgent取得了显著改进,凸显了结构化多模态具身对于交互式音乐理解的重要性。
引用
@article{arxiv.2601.11968,
title = {MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio},
author = {Qihao Zhao and Yunqi Cao and Yangyu Huang and Hui Yi Leong and Fan Zhang and Kim-Hui Yap and Wei Hu},
journal= {arXiv preprint arXiv:2601.11968},
year = {2026}
}
备注
Tech Report