MusicLIME:可解释的多模态音乐理解
声音
2025-03-19 v5 人工智能
机器学习
音频与语音处理
摘要
多模态模型对于音乐理解任务至关重要,因为它们捕捉了音频与歌词之间复杂的相互作用。然而,随着这些模型日益普及,对可解释性的需求也在增长——理解这些系统如何做出决策,对于确保公平性、减少偏见和培养信任至关重要。在本文中,我们介绍了 MusicLIME,一种针对多模态音乐模型设计的模型无关的特征重要性解释方法。传统的单模态方法分别分析每个模态,而不考虑它们之间的相互作用,这往往导致不完整或具有误导性的解释;与此不同,MusicLIME 揭示了音频和歌词特征如何相互作用并影响预测,从而提供了模型决策过程的全局视角。此外,我们通过将局部解释聚合为全局解释来增强局部解释,为用户提供了关于模型行为的更广阔视角。通过这项工作,我们致力于提升多模态音乐模型的可解释性,赋能用户做出明智选择,并促进更加公平、公正和透明的音乐理解系统。
引用
@article{arxiv.2409.10496,
title = {MusicLIME: Explainable Multimodal Music Understanding},
author = {Theodoros Sotirou and Vassilis Lyberatos and Orfeas Menis Mastromichalakis and Giorgos Stamou},
journal= {arXiv preprint arXiv:2409.10496},
year = {2025}
}
备注
GitHub repository: https://github.com/IamTheo2000/MusicLIME. To be presented at ICASSP 2025