积分梯度法的严谨研究及对内层神经元归因的扩展
机器学习
2022-07-01 v2
摘要
随着深度学习(DL)效能的提升,对其可解释性差的担忧也随之增长。归因方法通过量化输入特征对模型预测的重要性来解决可解释性问题。在各种方法中,积分梯度(Integrated Gradients, IG)声称其他方法未能满足理想的公理,而 IG 及类似方法独特地满足所述公理,从而脱颖而出。本文评论了 IG 及其应用/扩展的基本方面:1) 我们指出了 IG 函数空间与支持性文献的函数空间之间的关键差异,这些差异使先前关于 IG 唯一性的主张存在问题。我们表明,通过引入一个额外公理——非递减正性,可确立唯一性主张。2) 我们通过识别 IG 在所归因输入中 Lipschitz 连续或不连续的函数类,来解决输入敏感性问题。3) 我们表明,单基线方法的公理对具有概率分布基线的方法具有类似性质。4) 我们引入了一种计算高效的方法来识别对 IG 归因图中指定区域有贡献的内层神经元。最后,我们给出了验证该方法的实验结果。
引用
@article{arxiv.2202.11912,
title = {A Rigorous Study of Integrated Gradients Method and Extensions to Internal Neuron Attributions},
author = {Daniel Lundstrom and Tianjian Huang and Meisam Razaviyayn},
journal= {arXiv preprint arXiv:2202.11912},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:1703.01365 by other authors