通过能量约束保形反事实实现忠实的模型解释
机器学习
2023-12-19 v1 人工智能
摘要
反事实解释提供了一种直观且简单的方法来解释黑盒模型,并为个体提供算法追索权。为满足对合理解释的需求,现有工作主要依赖代理模型来学习输入数据的分布。这实际上将学习数据真实解释的任务从模型本身转移到了代理模型上。因此,生成的解释对人类而言可能看似合理,但未必能忠实地描述黑盒模型的行为。我们通过引入一种专门的评估指标来形式化这种忠实性概念,并提出了一种新颖的算法框架,用于生成能量约束保形反事实,其合理性仅限于模型所允许的范围。通过广泛的实证研究,我们证明 ECCCo 调和了对忠实性与合理性的需求。特别地,我们表明,对于具有梯度访问权限的模型,无需代理模型即可实现 SOTA 性能。为此,我们的框架仅依赖于定义黑盒模型本身的属性,利用了基于能量的建模和保形预测的最新进展。据我们所知,这是在生成忠实反事实解释方面的首次尝试。因此,我们期望 ECCCo 能作为未来研究的基线。我们相信,这项工作为寻求工具以更好区分可信模型与不可靠模型的研究人员和从业者开辟了新途径。
引用
@article{arxiv.2312.10648,
title = {Faithful Model Explanations through Energy-Constrained Conformal Counterfactuals},
author = {Patrick Altmeyer and Mojtaba Farmanbar and Arie van Deursen and Cynthia C. S. Liem},
journal= {arXiv preprint arXiv:2312.10648},
year = {2023}
}
备注
7 pages main paper, 34 pages appendix. Pre-print of upcoming proceedings paper (Association for the Advancement of Artificial Intelligence (www.aaai.org))