中文

白化对解释性能的影响

机器学习 2026-02-11 v1

摘要

可解释人工智能 (XAI) 旨在为机器学习模型提供透明的见解,然而许多特征归因方法的可靠性仍然是一个关键挑战。先前的研究 (Haufe et al., 2014; Wilming et al., 2022, 2023) 表明,这些方法常常错误地将重要性赋予非信息变量,例如抑制变量,导致根本性的误解。由于统计抑制是由特征依赖性引起的,本研究调查了数据白化(一种常见的去相关预处理技术)是否能减轻此类错误。使用已建立的 XAI-TRIS 基准 (Clark et al., 2024b),该基准提供合成真实数据和解释正确性的定量度量,我们实证评估了 16 种流行的特征归因方法与 5 种不同的白化变换相结合的效果。此外,我们分析了一个最小线性二维分类问题 (Wilming et al., 2023),以从理论上评估白化是否能消除抑制特征对贝叶斯最优模型的影响。我们的结果表明,虽然特定的白化技术可以改善解释性能,但改进程度在不同 XAI 方法和模型架构之间差异很大。这些发现凸显了数据非线性、预处理质量和归因保真度之间的复杂关系,强调了预处理技术在增强模型可解释性方面的关键作用。

关键词

引用

@article{arxiv.2602.09278,
  title  = {The effect of whitening on explanation performance},
  author = {Benedict Clark and Stoyan Karastoyanov and Rick Wilming and Stefan Haufe},
  journal= {arXiv preprint arXiv:2602.09278},
  year   = {2026}
}

备注

Presented at the NeurIPS 2024 workshop on Interpretable AI: Past, Present and Future