形式化神经网络反事实解释的鲁棒性
机器学习
2022-12-21 v3 人工智能
摘要
反事实解释(CFX)的使用是机器学习模型中日益流行的解释策略。然而,近期研究表明这些解释可能对底层模型的变化(例如重新训练后)不具备鲁棒性,这引发了其在真实世界应用中可靠性的疑问。现有解决该问题的尝试多为启发式方法,且所得 CFX 对模型变化的鲁棒性仅通过少量重训练模型评估,无法提供穷尽性保证。为此,我们提出 Δ-鲁棒性,这是首个正式且确定性地评估神经网络 CFX 鲁棒性(对模型变化)的概念。我们引入基于区间神经网络的抽象框架,以验证 CFX 对模型参数(即权重与偏置)可能无限集合变化的 Δ-鲁棒性。随后我们以两种不同方式展示该方法的效用。首先,我们分析了文献中若干 CFX 生成方法的 Δ-鲁棒性,表明它们在此方面普遍存在显著缺陷。其次,我们演示如何将 Δ-鲁棒性嵌入现有方法中,从而提供可证明鲁棒的 CFX。
引用
@article{arxiv.2208.14878,
title = {Formalising the Robustness of Counterfactual Explanations for Neural Networks},
author = {Junqi Jiang and Francesco Leofante and Antonio Rago and Francesca Toni},
journal= {arXiv preprint arXiv:2208.14878},
year = {2022}
}
备注
Accepted at AAAI 2023, camera-ready version