基于属性知情扰动的神经网络生成式反事实解释
机器学习
2021-01-19 v1 人工智能
摘要
随着深度神经网络(DNN)的广泛应用,模型可解释性已成为关键问题,因为在高风险场景中更偏好可解释的决策。当前的解释技术主要关注特征归因视角,在指示特定解释为何及如何与预测相关方面存在局限。为此,一类引人关注的解释——称为反事实(counterfactuals)——被发展出来以进一步探索用于解释的“假设”情境,并实现对黑盒模型的推理能力。然而,由于原始数据实例(即文本和图像)的高数据维度和非语义原始特征所带来的挑战,为其生成反事实仍处于早期阶段。在本文中,我们设计了一个框架,通过提出的属性知情扰动(AIP)专门生成原始数据实例的反事实。通过利用以不同属性为条件的生成模型,可以有效且高效地获得具有期望标签的反事实。我们并非直接在数据空间中修改实例,而是迭代优化所构建的属性知情潜空间,其中的特征更具鲁棒性和语义性。在真实世界文本和图像上的实验结果证明了我们所设计框架的有效性、样本质量以及效率,并显示出相对于其他替代方法的优越性。此外,我们还基于该框架介绍了一些实际应用,表明其在模型可解释性之外的潜力。
引用
@article{arxiv.2101.06930,
title = {Generative Counterfactuals for Neural Networks via Attribute-Informed Perturbation},
author = {Fan Yang and Ninghao Liu and Mengnan Du and Xia Hu},
journal= {arXiv preprint arXiv:2101.06930},
year = {2021}
}