重新思考解释:深度视觉分类器的输入无关显著性映射
计算机视觉与模式识别
2023-04-03 v1 人工智能
机器学习
摘要
显著性方法通过将输入特征归因于模型输出来提供事后模型解释。当前方法主要使用单个输入样本来实现这一点,因而无法回答关于模型的与输入无关的询问。我们还表明,输入特定的显著性映射本质上易于产生误导性的特征归因。当前使用“通用”输入特征进行模型解释的尝试假设可访问包含这些特征的数据集,这会使解释产生偏差。针对这一空白,我们引入了输入无关显著性映射的新视角,其以计算方式估计模型归因于其输出的高层特征。这些特征在几何上相关,并通过累积模型相对于无限制数据分布的梯度信息来计算。为计算这些特征,我们将独立数据点沿模型损失曲面推向与人类可理解概念(例如分类器的类别标签)相关的局部极小值。通过系统的投影、缩放和精炼过程,该信息被转化为可解释的可视化,且不损害其模型保真度。该可视化作为独立的定性解释。通过广泛评估,我们不仅展示了针对大规模模型多种概念的成功可视化,还展示了这种新形式显著性映射的一个有趣用途:识别被攻陷分类器中的后门签名。
引用
@article{arxiv.2303.17836,
title = {Rethinking interpretation: Input-agnostic saliency mapping of deep visual classifiers},
author = {Naveed Akhtar and Mohammad A. A. K. Jalwana},
journal= {arXiv preprint arXiv:2303.17836},
year = {2023}
}
备注
Accepted for publication in AAAI 2023