Diffexplainer:基于扩散模型的跨模态全局解释
计算机视觉与模式识别
2024-04-04 v1 人工智能
摘要
我们提出了DiffExplainer,一个新颖的框架,利用语言-视觉模型实现多模态全局可解释性。DiffExplainer采用基于优化文本提示的条件扩散模型,合成能够最大化分类器类别输出和隐藏特征的图像,从而为解释决策提供视觉工具。此外,对生成的视觉描述进行分析可以自动识别偏差和虚假特征,而传统方法通常依赖人工干预。语言-视觉模型的跨模态可迁移性还使得能够以更符合人类解释的方式(即通过文本)描述决策。我们进行了全面的实验,包括一项广泛的用户研究,证明了DiffExplainer在以下方面的有效性:1)生成高质量图像解释模型决策,超越了现有的激活最大化方法;2)自动识别偏差和虚假特征。
引用
@article{arxiv.2404.02618,
title = {Diffexplainer: Towards Cross-modal Global Explanations with Diffusion Models},
author = {Matteo Pennisi and Giovanni Bellitto and Simone Palazzo and Mubarak Shah and Concetto Spampinato},
journal= {arXiv preprint arXiv:2404.02618},
year = {2024}
}