潜扩散反事实解释
机器学习
2023-10-11 v1 计算机视觉与模式识别
摘要
反事实解释已成为阐明不透明黑盒模型行为的一种有前景的方法。近来,若干工作利用像素空间扩散模型进行反事实生成。为处理反事实生成过程中的噪声对抗梯度——其导致不真实伪影或仅是对抗扰动——它们要么需要辅助的对抗鲁棒模型,要么需要计算密集的引导方案。然而,此类要求限制了其适用性,例如在难以获取模型训练数据的场景中。为应对这些局限,我们引入潜扩散反事实解释(LDCE)。LDCE利用近期类别或文本条件基础潜扩散模型的能力,加速反事实生成并聚焦于数据中重要的语义部分。此外,我们提出一种新颖的共识引导机制,以过滤掉与扩散模型隐式分类器不一致的噪声对抗梯度。我们展示了LDCE在多种学习范式下、训练于不同数据集的广泛模型上的通用性。最后,我们展示LDCE如何提供对模型错误的洞察,增进我们对黑盒模型行为的理解。
引用
@article{arxiv.2310.06668,
title = {Latent Diffusion Counterfactual Explanations},
author = {Karim Farid and Simon Schrodi and Max Argus and Thomas Brox},
journal= {arXiv preprint arXiv:2310.06668},
year = {2023}
}