中文

迈向忠实的神经网络内在解释:基于 Shapley 加性自归因

机器学习 2023-09-28 v1

摘要

自解释神经网络已引起研究的显著兴趣。该领域的现有工作往往 (1) 缺乏确保真正可解释性的坚实理论基础,或 (2) 牺牲模型表达能力。为此,我们构建了通用的加性自归因(Additive Self-Attribution, ASA)框架。观察到加性自归因中 Shapley 值的缺失,我们提出 Shapley 加性自归因神经网络(Shapley Additive Self-Attributing Neural Network, SASANet),并在理论上保证自归因值等于输出的 Shapley 值。具体而言,SASANet 采用基于边际贡献的序列模式与基于内部蒸馏的训练策略,对任意数量的特征建模有意义的输出,从而得到未近似的有意义值函数。我们的实验结果表明,SASANet 在性能上超越现有自归因模型,并与黑盒模型相媲美。此外,SASANet 在解释自身预测时比事后方法更精确且更高效。

关键词

引用

@article{arxiv.2309.15559,
  title  = {Towards Faithful Neural Network Intrinsic Interpretation with Shapley Additive Self-Attribution},
  author = {Ying Sun and Hengshu Zhu and Hui Xiong},
  journal= {arXiv preprint arXiv:2309.15559},
  year   = {2023}
}