从对齐视角统一修改 BP 归因中的令人困惑行为
机器学习
2025-03-17 v1 人工智能
摘要
归因旨在识别与决策过程相关的输入像素。一种流行的方法是使用修改的反向传播(BP)规则来逆转决策,与原始梯度相比,这提高了可解释性。然而,这些方法缺乏坚实的理论基础,并表现出令人困惑的行为,例如对参数随机化的敏感性降低,这引发了对其可靠性的担忧,并凸显了理论论证的必要性。在这项工作中,我们为 GBP、RectGrad、LRP 和 DTD 等方法提出了一个统一的理论框架,证明它们通过结合已激活神经元的权重来实现输入对齐。这种对齐提高了可视化质量,并降低了对权重随机化的敏感性。我们的贡献包括:(1)为多种行为提供统一的解释,而非仅关注单一行为。(2)准确预测新行为。(3)提供对决策过程的洞察,包括逐层信息变化以及归因与模型决策之间的关系。
引用
@article{arxiv.2503.11160,
title = {Unifying Perplexing Behaviors in Modified BP Attributions through Alignment Perspective},
author = {Guanhua Zheng and Jitao Sang and Changsheng Xu},
journal= {arXiv preprint arXiv:2503.11160},
year = {2025}
}
备注
11 pages, 9 figures