中文

利用生成模型移除输入特征以解释图像分类器

机器学习 2020-10-07 v7 计算机视觉与模式识别 机器学习

摘要

基于扰动的解释方法通常通过启发式地移除输入特征(例如模糊、加噪或置灰)来衡量其对图像分类器输出的贡献,这往往会产生不真实、超出样本分布的样本。相反,我们提出将生成式修复模型(generative inpainter)集成到三种具有代表性的归因方法中以移除输入特征。我们所提出的改动在以下三方面改进了所有三种方法:(1) 在真实数据分布下生成更合理的反事实样本;(2) 根据三个指标(目标定位、删除和显著性指标)更加准确;(3) 对超参数变化更加鲁棒。我们的发现在 ImageNet 和 Places365 数据集以及两对不同的分类器与修复模型上均一致。

关键词

引用

@article{arxiv.1910.04256,
  title  = {Explaining image classifiers by removing input features using generative models},
  author = {Chirag Agarwal and Anh Nguyen},
  journal= {arXiv preprint arXiv:1910.04256},
  year   = {2020}
}

备注

Accepted to Asian Conference on Computer Vision (ACCV), 2020