中文

互信息保持反向传播:学习反演以实现忠实归因

机器学习 2021-04-15 v1 人工智能

摘要

基于反向传播的可视化方法已被提出用于解释深度神经网络(DNNs),其中一些产生了具有良好视觉质量的解释。然而,对于这些直观可视化是否与网络决策相关存在疑虑。近期研究通过验证几乎所有这类改进的反向传播可视化均不忠实于模型的决策过程,证实了该怀疑。此外,这些可视化产生模糊的“相对重要性分数”,其中低值无法保证独立于最终预测。因此,亟需开发一种新颖的反向传播框架,以保证理论忠实性并产出具有清晰含义的定量归因分数。为实现该目标,我们借助互信息理论生成解释,研究输出中多少信息编码于每个输入神经元。基本思想是通过反向传播学习源信号,使得输入与输出之间的互信息应尽可能多地保留在输入与源信号的互信息中。此外,我们提出一种互信息保持反演网络,称为 MIP-IN,其中各层参数被递归训练以学习如何反演。在反演过程中,采用前向 Relu 操作使通用解释适配特定输入。我们随后经验性地证明,反演得到的源信号满足完备性与极小性,这对忠实解释至关重要。进一步,实证研究验证了 MIP-IN 生成解释的有效性。

关键词

引用

@article{arxiv.2104.06629,
  title  = {Mutual Information Preserving Back-propagation: Learn to Invert for Faithful Attribution},
  author = {Huiqi Deng and Na Zou and Weifu Chen and Guocan Feng and Mengnan Du and Xia Hu},
  journal= {arXiv preprint arXiv:2104.06629},
  year   = {2021}
}