ECINN:基于可逆神经网络的高效反事实样本生成
机器学习
2021-04-07 v2 计算机视觉与模式识别
摘要
反事实样本可识别如何改变输入以更改分类器的预测类别,从而揭示例如深度神经网络等黑盒模型的本质。我们提出一种名为 ECINN 的方法,利用用于图像分类的可逆神经网络的生成能力来高效生成反事实样本。与有时需要上千次或更多分类器评估的竞争性方法不同,ECINN 具有闭式表达式,且仅需两次评估的时间即可生成反事实样本。可以说,生成反事实样本的主要挑战在于仅改变影响预测结果的输入特征,即依赖于类别的特征。我们的实验展示了 ECINN 如何改变依赖于类别的图像区域,以更改反事实样本的感知类别与预测类别。此外,我们将 ECINN 扩展为还能生成热力图(ECINNh),以便于轻松检视所生成反事实样本中成对的类别依赖变化。在实验中,我们发现 ECINNh 优于生成基于热力图解释的既有方法。
引用
@article{arxiv.2103.13701,
title = {ECINN: Efficient Counterfactuals from Invertible Neural Networks},
author = {Frederik Hvilshøj and Alexandros Iosifidis and Ira Assent},
journal= {arXiv preprint arXiv:2103.13701},
year = {2021}
}