超越输出忠实性:学习保留计算路径的归因
机器学习
2025-12-05 v2 人工智能
摘要
诸如插入与删除的忠实性指标评估了特征移除如何影响模型输出,却忽略了所给出的解释是否保留了网络实际使用的计算路径。我们表明,外部指标可以通过替代路径最大化——即通过不同的特征检测器重新路由计算,同时保持输出行为的扰动。为解决这一问题,我们提出将激活保留作为保留计算路径的可处理代理。我们引入了忠实性引导的集成解释,该方法联合优化外部忠实性(通过对插入/删除曲线进行集成分位数优化)与内部忠实性(通过选择性梯度裁剪)。在 ImageNet 和 CUB-200-2011 上的 VGG 和 ResNet 中,FEI 实现了 SOTA 的插入/删除分数,同时保持了显著较低的激活偏差,这表明外部与内部忠实性对于可靠的解释均不可或缺。
引用
@article{arxiv.2509.04588,
title = {Beyond Output Faithfulness: Learning Attributions that Preserve Computational Pathways},
author = {Siyu Zhang and Kenneth Mcmillan},
journal= {arXiv preprint arXiv:2509.04588},
year = {2025}
}