中文

特征显著性——而非任务信息性——驱动机器学习模型解释

机器学习 2026-02-19 v3

摘要

可解释人工智能(XAI)旨在提供对机器学习模型决策过程的洞察,其中一个目标是识别故障,如捷径学习。该承诺依赖于该领域的假设,即XAI标记为重要的输入特征必须包含关于目标变量的信息。然而,信息性是否 indeed 是实践中重要性归因的主要驱动因素尚不清楚,或其他数据属性如统计抑制、测试时新颖性或高特征显著性是否在很大程度上贡献了。为澄清这一点,我们在三个二元图像分类任务上训练深度学习模型,其中translucent水印要么不存在,要么充当类别相关的混淆因素,要么代表类别无关的噪声。对于五种流行的归因方法,结果显示在水印区域(RIW)中呈现显著提升的相对重要性(R2.45R^2 \geq .45),而水印是否为类别相关仅对RIW有微小影响(R2.03R^2 \leq .03),尽管对模型性能和泛化能力有明确影响。XAI方法对模型中性边缘检测滤波器表现相似, 当图像强度被编码为较小的特征值时,会对水印分配 substantially 更少的重要性。这些结果表明,重要性归因最强烈地由测试时图像结构的显著性而非机器学习模型所学习的统计关联所驱动。应重新评估之前成功应用XAI的研究,针对特征显著性与信息性之间可能的虚假相关性,以及使用特征归因方法作为构建块的工作流程应受到审查。

关键词

引用

@article{arxiv.2602.09238,
  title  = {Feature salience - not task-informativeness - drives machine learning model explanations},
  author = {Benedict Clark and Marta Oliveira and Rick Wilming and Stefan Haufe},
  journal= {arXiv preprint arXiv:2602.09238},
  year   = {2026}
}