中文

归一化AOPC:修复特征归因可解释性中具有误导性的忠实性指标

机器学习 2025-05-26 v2

摘要

深度神经网络的预测众所周知难以解释。特征归因方法旨在通过识别每个输入特征的贡献来解释这些预测。忠实性通常使用扰动曲线面积(AOPC)来评估,反映了特征归因在描述深度神经网络内部机制方面的准确性。然而,许多研究依赖AOPC来比较不同模型的忠实性,我们证明这可能导致关于模型忠实性的错误结论。具体而言,我们发现AOPC对模型的变化敏感,导致不可靠的跨模型比较。此外,在不了解模型特定的上下限的情况下,AOPC分数难以单独解释。为了解决这些问题,我们提出了一种归一化方法——归一化AOPC(NAOPC),使得跨模型评估具有一致性并能更有意义地解释单个分数。我们的实验证明这种归一化可以根本性地改变AOPC结果,质疑早期研究的结论,并为评估特征归因忠实性提供了一个更稳健的框架。我们的代码可在 https://github.com/JoakimEdin/naopc 获取。

关键词

引用

@article{arxiv.2408.08137,
  title  = {Normalized AOPC: Fixing Misleading Faithfulness Metrics for Feature Attribution Explainability},
  author = {Joakim Edin and Andreas Geert Motzfeldt and Casper L. Christensen and Tuukka Ruotsalo and Lars Maaløe and Maria Maistro},
  journal= {arXiv preprint arXiv:2408.08137},
  year   = {2025}
}

备注

Accepted to ACL 2025 Main