消除非线性模型解释中的误报归因
机器学习
2025-10-28 v3 机器学习
摘要
抑制变量(suppressor variables)可以影响模型预测而不依赖于目标结果,这对可解释人工智能(XAI)方法构成重大挑战。这些变量可能导致错误的特征归因,从而削弱解释的实用性。虽然针对线性模型已有有效 remedies,但其对非线性模型和基于实例的解释的扩展仍受限。我们提出了 PatternLocal(一种新型 XAI 技术),以弥补这一差距。PatternLocal 首先采用局部线性旁近模型(如 LIME、KernelSHAP 或梯度方法),将其判别模型权重转化为生成表示,从而抑制抑制变量的影响,同时保持局部保真。在 XAI-TRIS 框架上的大规模超参数优化中,PatternLocal 在解释非线性任务时始终优于其他 XAI 方法,并显著降低误报归因,从而实现更可靠和可操作的洞察。我们进一步在 EEG 运动意象数据集上评估了 PatternLocal,证明其解释符合生理学常识。
引用
@article{arxiv.2505.11210,
title = {Minimizing False-Positive Attributions in Explanations of Non-Linear Models},
author = {Anders Gjølbye and Stefan Haufe and Lars Kai Hansen},
journal= {arXiv preprint arXiv:2505.11210},
year = {2025}
}
备注
Accepted at NeurIPS 2025. Code: https://github.com/gjoelbye/PatternLocal