对抗式反事实视觉解释
计算机视觉与模式识别
2023-03-20 v1
摘要
反事实解释与对抗攻击具有相关目标:以最小扰动翻转输出标签,而不论扰动特征如何。然而,对抗攻击不能直接用于反事实解释视角,因为此类扰动被视为噪声而非可操作且可理解的图像修改。基于鲁棒学习文献,本文提出一种优雅方法,将对抗攻击转化为语义上有意义的扰动,且无需修改待解释的分类器。所提方法假设去噪扩散概率模型(Denoising Diffusion Probabilistic Models)在生成对抗攻击时是避免高频与分布外扰动的极佳正则化器。本文核心思想是通过扩散模型构建攻击以对其加以润色。这使得无论目标模型的鲁棒化水平如何均可对其加以研究。大量实验表明,我们的反事实解释方法在多个测试平台上优于当前最先进水平(State-of-the-Art)。
引用
@article{arxiv.2303.09962,
title = {Adversarial Counterfactual Visual Explanations},
author = {Guillaume Jeanneret and Loïc Simon and Frédéric Jurie},
journal= {arXiv preprint arXiv:2303.09962},
year = {2023}
}
备注
CVPR 2023 camera-ready; Main manuscript + supplementary material