中文

TinyMU:用于音乐理解的紧凑型音频-语言模型

声音 2026-04-20 v1

摘要

音乐理解与推理是音乐信息检索领域的核心挑战,应用范围涵盖检索、推荐、音乐智能体和虚拟助手等。近期大型音频-语言模型(LALMs)在跟随用户指令回答音乐相关问题方面显示出显著进展。然而,其巨大规模(通常为数十亿参数)导致训练成本高昂、推理缓慢且在边缘设备上部署受限。本文提出 TinyMU,一个轻量级(2.29 亿参数)音乐-语言模型(MLM),在保持高效紧凑的同时,实现了与大型 LALMs 相当的性能。为训练 TinyMU,我们引入 MusicSkills-3.5M,一个精心挑选的、以音乐为 grounding 的问答数据集,包含 350 万样本。该数据集涵盖多选、二选和开放式格式,为 diverse 音乐概念提供细粒度监督。其架构利用 MATPAC++(针对细粒度特征提取的 SOTA 自监督音频编码器)与轻量级线性投影器配合,高效地将音频嵌入与语言模型对齐。通过广泛的评估,我们表明 TinyMU 在基本音乐理解和复杂推理方面均表现强劲。值得注意的是,在 MuChoMusic 基准测试中,TinyMU 虽仅为 SOTA LALM 的 1/35,却实现了 82% 的性能,凸显了在受限计算预算下小型 MLM 的潜力。

关键词

引用

@article{arxiv.2604.15849,
  title  = {TinyMU: A Compact Audio-Language Model for Music Understanding},
  author = {Xiquan Li and Aurian Quelennec and Slim Essid},
  journal= {arXiv preprint arXiv:2604.15849},
  year   = {2026}
}

备注

ICASSP 2026