中文

对抗式反事实视觉解释

计算机视觉与模式识别 2023-03-20 v1

摘要

反事实解释与对抗攻击具有相关目标:以最小扰动翻转输出标签,而不论扰动特征如何。然而,对抗攻击不能直接用于反事实解释视角,因为此类扰动被视为噪声而非可操作且可理解的图像修改。基于鲁棒学习文献,本文提出一种优雅方法,将对抗攻击转化为语义上有意义的扰动,且无需修改待解释的分类器。所提方法假设去噪扩散概率模型(Denoising Diffusion Probabilistic Models)在生成对抗攻击时是避免高频与分布外扰动的极佳正则化器。本文核心思想是通过扩散模型构建攻击以对其加以润色。这使得无论目标模型的鲁棒化水平如何均可对其加以研究。大量实验表明,我们的反事实解释方法在多个测试平台上优于当前最先进水平(State-of-the-Art)。

关键词

引用

@article{arxiv.2303.09962,
  title  = {Adversarial Counterfactual Visual Explanations},
  author = {Guillaume Jeanneret and Loïc Simon and Frédéric Jurie},
  journal= {arXiv preprint arXiv:2303.09962},
  year   = {2023}
}

备注

CVPR 2023 camera-ready; Main manuscript + supplementary material