中文

超越输出忠实性:学习保留计算路径的归因

机器学习 2025-12-05 v2 人工智能

摘要

诸如插入与删除的忠实性指标评估了特征移除如何影响模型输出,却忽略了所给出的解释是否保留了网络实际使用的计算路径。我们表明,外部指标可以通过替代路径最大化——即通过不同的特征检测器重新路由计算,同时保持输出行为的扰动。为解决这一问题,我们提出将激活保留作为保留计算路径的可处理代理。我们引入了忠实性引导的集成解释,该方法联合优化外部忠实性(通过对插入/删除曲线进行集成分位数优化)与内部忠实性(通过选择性梯度裁剪)。在 ImageNet 和 CUB-200-2011 上的 VGG 和 ResNet 中,FEI 实现了 SOTA 的插入/删除分数,同时保持了显著较低的激活偏差,这表明外部与内部忠实性对于可靠的解释均不可或缺。

关键词

引用

@article{arxiv.2509.04588,
  title  = {Beyond Output Faithfulness: Learning Attributions that Preserve Computational Pathways},
  author = {Siyu Zhang and Kenneth Mcmillan},
  journal= {arXiv preprint arXiv:2509.04588},
  year   = {2025}
}