中文

通过渐进式干预与测量属性梯度进行局部解释预测行为

机器学习 2025-09-18 v2 计算机视觉与模式识别

摘要

深度学习模型取得了很高的预测性能,但缺乏固有的可解释性,阻碍了我们对所学预测行为的理解。现有的局部可解释性方法侧重于关联关系,忽略了模型预测的因果驱动因素。其他方法采用因果视角,但主要提供全局的、模型层面的解释。然而,对于特定输入,全局识别出的因素是否适用于局部尚不清楚。为了解决这一局限性,我们利用图像到图像编辑模型的最新进展,引入了一种新的局部干预解释框架。我们的方法对语义属性执行渐进式干预,并使用一种新的评分——期望属性梯度幅度,来量化其对模型预测的相应影响。我们通过对各种架构和任务的广泛实证评估,证明了该方法的有效性。首先,我们在合成场景中验证了该方法,并展示了其局部识别偏差的能力。随后,我们应用该方法研究了医学皮肤病变分类器,分析了网络训练动态,并利用现实生活中的干预数据研究了预训练的 CLIP 模型。我们的结果突显了在属性层面进行干预解释的潜力,能够为深度模型的行为揭示新的见解。

关键词

引用

@article{arxiv.2503.05424,
  title  = {Locally Explaining Prediction Behavior via Gradual Interventions and Measuring Property Gradients},
  author = {Niklas Penzel and Joachim Denzler},
  journal= {arXiv preprint arXiv:2503.05424},
  year   = {2025}
}

备注

Accepted at WACV-2026, 45 pages, 39 figures, 15 tables