中文

解码多模态之谜:关于多模态注意力模型可解释性采用系统综述

机器学习 2026-04-28 v1 人工智能

摘要

近年来,多模态学习取得显著进展,尤其是通过集成注意力模型,在各种任务中实现了显著的性能提升。与此同时,对可解释人工智能(XAI)的需求也推动了大量研究致力于解释这些模型的复杂决策过程。本 systematic literature review 分析了2020年1月至2024年初期间聚焦多模态模型可解释性的研究。我们在更广泛的XAI目标框架下,横跨多个维度审视文献,包括模型架构、涉及的模态、解释算法及评估方法。我们的分析表明,大多数研究集中在视觉-语言和语言单模态模型上,注意力方法是最常用的解释技术。然而,这些方法往往难以捕捉模态之间交互的完整图谱,这一挑战因领域间的架构异构性而进一步加剧。重要的是,我们发现多模态XAI的评估方法缺乏系统性,缺乏一致性、鲁棒性,以及对模态特定认知和情境因素的考虑。基于这些发现,我们提供了一套全面的建议,旨在推动多模态XAI研究中严谨、透明且标准化的评估和报告实践。我们的目标是支持未来研究,构建更具可解释性、可 accountability 以及负责任的多模态AI系统,其核心是可解释性。

关键词

引用

@article{arxiv.2508.04427,
  title  = {Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models},
  author = {Md Raisul Kibria and Sébastien Lafond and Janan Arslan},
  journal= {arXiv preprint arXiv:2508.04427},
  year   = {2026}
}