中文

基于负通量聚合的特征归因估计

机器学习 2023-05-16 v2

摘要

由于安全和/或透明度担忧日益增长,对理解深度神经网络(DNNs)行为的需求不断增加。由于深度神经网络架构的多层非线性,解释DNN预测仍是一个开放问题,阻碍我们深入理解其机制。为增强DNN的可解释性,我们利用散度和通量估计输入特征对预测任务的归因。受向量分析中散度定理的启发,我们提出了一种新颖的负通量聚合(NeFLAG)公式以及一种高效的近似算法来估计归因图。与以往技术不同,我们的方法既不依赖拟合代理模型,也不需要任何梯度的路径积分。定性和定量实验均表明,NeFLAG在生成比对比方法更忠实的归因图方面具有优越性能。我们的代码见 \url{https://github.com/xinli0928/NeFLAG}

关键词

引用

@article{arxiv.2301.06989,
  title  = {Negative Flux Aggregation to Estimate Feature Attributions},
  author = {Xin Li and Deng Pan and Chengyin Li and Yao Qiang and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2301.06989},
  year   = {2023}
}

备注

14 pages, 4 figures, 2 tables