中文

判别性特征归因:连接事后可解释性与内在可解释性

机器学习 2024-02-19 v2 计算机视觉与模式识别

摘要

随着机器学习模型在各种现实应用中的部署日益增多,研究人员与从业者均强调了对模型行为解释的必要性。为此,先前文献中概述了两类广泛的策略来解释模型。事后解释方法通过识别对模型预测至关重要的特征来解释复杂黑盒模型的行为;然而,先前工作表明这些解释可能不忠实,因为它们错误地将高重要性归因于对底层任务不重要或非判别性的特征。另一方面,内在可解释模型通过将解释显式编码进模型架构来规避这些问题,意味着其解释天然忠实,但由于表达能力有限,常表现出较差的预测性能。在本工作中,我们识别出特征归因缺乏忠实性的一个关键原因:底层黑盒模型缺乏鲁棒性,尤其对输入中不重要干扰特征的擦除。为解决该问题,我们提出干扰擦除调优(DiET),一种使黑盒模型对干扰擦除鲁棒的自适应方法,从而提供判别且忠实的归因。该策略自然结合了事后解释的易用性与内在可解释模型的忠实性。我们在半合成与真实世界数据集上进行了广泛实验,表明 DiET 产生的模型(1)紧密近似其旨在解释的原始黑盒模型,且(2)产生与按构造可用的近似基真相匹配的解释。我们的代码已在 https://github.com/AI4LIFE-GROUP/DiET 公开。

关键词

引用

@article{arxiv.2307.15007,
  title  = {Discriminative Feature Attributions: Bridging Post Hoc Explainability and Inherent Interpretability},
  author = {Usha Bhalla and Suraj Srinivas and Himabindu Lakkaraju},
  journal= {arXiv preprint arXiv:2307.15007},
  year   = {2024}
}