中文

探究音频大语言模型在音乐中的模态贡献

机器学习 2026-05-18 v2 声音

摘要

音频大语言模型(Audio LLM)使关于音乐的人机对话成为可能,但尚不清楚它们是否真正在聆听音频还是仅使用文本推理,正如最近的基准测试所暗示的那样。本文通过量化每个模态对模型输出的贡献来研究这一问题。我们采用了 MM-SHAP 框架,这是一种基于 Shapley 值的性能无关评分,用于量化每个模态对模型预测的相对贡献。我们在 MuChoMusic 基准上评估了两个模型,发现准确率较高的模型更依赖文本来回答问题,但进一步检查表明,即使总体音频贡献较低,模型也能成功定位关键声音事件,这表明音频并未被完全忽略。本研究是 MM-SHAP 在 Audio LLM 中的首次应用,我们希望它能成为未来可解释人工智能和音频研究的基础性一步。

关键词

引用

@article{arxiv.2509.20641,
  title  = {Investigating Modality Contribution in Audio LLMs for Music},
  author = {Giovana Morais and Magdalena Fuentes},
  journal= {arXiv preprint arXiv:2509.20641},
  year   = {2026}
}

备注

5 pages, 2 figures, accepted at ICASSP 2026