中文

VALE:一种用于图像分类器的多模态视觉与语言解释框架

计算机视觉与模式识别 2024-08-26 v1 人工智能 计算与语言 机器学习

摘要

深度神经网络(DNN)通过实现任务自动化和减少人类错误而在各领域取得了突破。然而,其内部工作和决策过程因其黑盒性质而保持神秘。因此,缺乏可解释性限制了这些模型在高风险场景中的应用。为了解决这一问题,解释人工智能(XAI)领域旨在解释和解释DNN的内部工作。尽管取得了进展,但XAI仍面临语义鸿沟、可解释性与性能之间的权衡以及需要具体情境解释的问题。为了克服这些限制,我们提出一种新型多模态框架,称为VALE视觉与语言解释。VALE将解释人工智能技术与先进语言模型集成,以提供全面的解释。该框架利用XAI工具从视觉方面提供解释,结合先进的零样本图像分割模型和视觉语言模型,以生成相应的文本解释。通过将视觉和文本解释相结合,VALE弥合了机器输出与人类解释之间的语义鸿沟,为用户提供更易于理解的结果。本文对VALE框架进行了针对图像分类任务的示范研究。具体而言,使用Shapley可加解释(SHAP)识别分类图像中最具影响力的区域。然后,使用Segment Anything Model(SAM)提取感兴趣对象,并利用最先进的预训练视觉语言模型(VLMs)生成解释。在ImageNet数据集和自定义水下SONAR图像数据集上进行大量实验,表明VALE在水下图像分类中具有实际应用价值。

关键词

引用

@article{arxiv.2408.12808,
  title  = {VALE: A Multimodal Visual and Language Explanation Framework for Image Classifiers using eXplainable AI and Language Models},
  author = {Purushothaman Natarajan and Athira Nambiar},
  journal= {arXiv preprint arXiv:2408.12808},
  year   = {2024}
}

备注

15 pages, 10 tables, 3 figures