中文

cc-Shapley:测度多变量特征重要性需要因果上下文

机器学习 2026-03-30 v3 统计方法学

摘要

可解释人工智能旨在揭示相关特征,从而帮助人类检查和审查机器学习模型,甚至促进科学发现。考虑到 Shapley 值的广泛应用,我们发现仅数据驱动的多变量特征重要性操作化方法并不适用于此目的。即使在两个特征的简单问题中,仅在观察性语境下考虑单个特征,都会因共线偏置和抑制效应引发虚假关联,这可能导致误解。需要对数据生成过程的因果知识来识别和纠正此类误导性特征归因。我们提出 cc-Shapley(因果上下文 Shapley),这是一种基于数据因果结构的常规观察性 Shapley 值的干预性修改,旨在分析特征在剩余特征的因果语境中的相关性。我们在理论上证明,这消除了由共线偏置引起的虚假关联。我们比较了在各种、合成和真实数据集上 Shapley 值与 cc-Shapley 值的行为。我们观察到当从观察性转向 cc-Shapley 时,与单变量特征重要性相比,某些关联的显著性或被颠倒。

关键词

引用

@article{arxiv.2602.20396,
  title  = {cc-Shapley: Measuring Multivariate Feature Importance Needs Causal Context},
  author = {Jörg Martin and Stefan Haufe},
  journal= {arXiv preprint arXiv:2602.20396},
  year   = {2026}
}