GradCFA:一种用于神经网络局部解释的混合梯度基反事实和特征归因解释算法
机器学习
2026-03-17 v1 人工智能
摘要
可解释人工智能 (XAI) 正在成为越来越重要的关键领域,如医疗和金融,提供对 AI 驱动决策的透明度。反事实解释 (CFX) 和特征归因 (FA) 是两种主要的 XAI 范式,分别在模型可解释性中发挥不同作用。本研究引入了 GradCFA,这是一种结合 CFX 和 FA 的混合框架,通过显式优化可行性、可信度和多样性来提高可解释性——这些是现有方法中常常不平衡的关键质量。不同于大多数 CFX 研究聚焦于二元分类,GradCFA 扩展到多类场景,支持更广泛的应用。我们评估了 GradCFA 的有效性、proximity、稀疏性、可信度和多样性,与包括 Wachter、DiCE、CARE 在内的先进 CFX 方法,以及 SHAP 用于 FA。结果表明,GradCFA 有效地生成可行、可信且多样的反事实解释,同时提供有价值的 FA 见解。通过识别有影响力的特征并验证其影响,GradCFA 推进了 AI 可解释性。该工作实现代码可在:https://github.com/jacob-ws/GradCFs 查看。
引用
@article{arxiv.2603.15373,
title = {GradCFA: A Hybrid Gradient-Based Counterfactual and Feature Attribution Explanation Algorithm for Local Interpretation of Neural Networks},
author = {Jacob Sanderson and Hua Mao and Wai Lok Woo},
journal= {arXiv preprint arXiv:2603.15373},
year = {2026}
}