少即是多:发现简洁的网络解释
计算机视觉与模式识别
2024-07-09 v3
摘要
我们引入了发现概念网络解释(DCNE),一种生成人类可理解的视觉解释以增强深度神经图像分类器可解释性的新方法。我们的方法自动发现对于区分类别至关重要的视觉解释。这是通过同时优化三个标准来实现的:解释应该少、多样化且人类可解释。我们的方法建立在最近引入的概念相关性传播(CRP)可解释性方法之上。虽然CRP能有效描述单个神经元激活,但它生成的概念过多,影响了人类的理解。相反,DCNE选择少数最重要的解释。我们引入了一个新的评估数据集,专注于鸟类分类这一具有挑战性的任务,使我们能够比较DCNE的解释与人类专家定义的解释的一致性。与现有的可解释人工智能(XAI)方法相比,DCNE在总结网络解释时在简洁性和完整性之间取得了理想的权衡。它产生的解释数量仅为CRP的1/30,而解释质量仅略有下降。DCNE代表了使神经网络决策对人类可访问和可理解的一步,为XAI和模型对齐领域的研究人员和从业者提供了有价值的工具。
引用
@article{arxiv.2405.15243,
title = {Less is More: Discovering Concise Network Explanations},
author = {Neehar Kondapaneni and Markus Marks and Oisin Mac Aodha and Pietro Perona},
journal= {arXiv preprint arXiv:2405.15243},
year = {2024}
}
备注
9 pages, 5 figures; ICLR Re-Align Workshop 2024; Project Page: https://www.vision.caltech.edu/dcne/ Github: https://github.com/nkondapa/DiscoveringConciseNetworkExplanations