中文

MEGL:多模态解释引导学习

计算机视觉与模式识别 2024-11-21 v1 人工智能 机器学习

摘要

解释人工智能(AI)模型的决策过程对于解决其“黑盒”性质至关重要,尤其是在图像分类等任务中。传统的可解释 AI(XAI)方法通常依赖单模态解释,要么是视觉的,要么是文本的,两者各有其固有的局限性。视觉解释突出了关键区域,但往往缺乏逻辑依据;而文本解释提供了上下文,却缺乏空间定位。此外,这两种解释都可能不一致或不完整,限制了其可靠性。为了应对这些挑战,我们提出了一种新颖的多模态解释引导学习(MEGL)框架,该框架同时利用视觉和文本解释来增强模型的可解释性并提高分类性能。我们的显著性驱动文本定位(SDTG)方法将视觉解释中的空间信息整合到文本逻辑依据中,提供具有空间定位和丰富上下文的解释。此外,我们引入了对视觉解释的文本监督,即使在缺失真实视觉标注的情况下,也能将视觉解释与文本逻辑依据对齐。视觉解释分布一致性损失通过将生成的视觉解释与数据集级别的模式对齐,进一步增强了视觉连贯性,使模型能够有效地从不完整的多模态监督中学习。我们在两个新数据集 Object-ME 和 Action-ME 上验证了 MEGL,用于具有多模态解释的图像分类。实验结果表明,MEGL 在视觉和文本领域的预测准确率和解释质量上均优于以往方法。我们的代码将在论文被接收后公开。

关键词

引用

@article{arxiv.2411.13053,
  title  = {MEGL: Multimodal Explanation-Guided Learning},
  author = {Yifei Zhang and Tianxu Jiang and Bo Pan and Jingyu Wang and Guangji Bai and Liang Zhao},
  journal= {arXiv preprint arXiv:2411.13053},
  year   = {2024}
}