利用生成模型移除输入特征以解释图像分类器
机器学习
2020-10-07 v7 计算机视觉与模式识别
机器学习
摘要
基于扰动的解释方法通常通过启发式地移除输入特征(例如模糊、加噪或置灰)来衡量其对图像分类器输出的贡献,这往往会产生不真实、超出样本分布的样本。相反,我们提出将生成式修复模型(generative inpainter)集成到三种具有代表性的归因方法中以移除输入特征。我们所提出的改动在以下三方面改进了所有三种方法:(1) 在真实数据分布下生成更合理的反事实样本;(2) 根据三个指标(目标定位、删除和显著性指标)更加准确;(3) 对超参数变化更加鲁棒。我们的发现在 ImageNet 和 Places365 数据集以及两对不同的分类器与修复模型上均一致。
引用
@article{arxiv.1910.04256,
title = {Explaining image classifiers by removing input features using generative models},
author = {Chirag Agarwal and Anh Nguyen},
journal= {arXiv preprint arXiv:1910.04256},
year = {2020}
}
备注
Accepted to Asian Conference on Computer Vision (ACCV), 2020