中文

基于神经元的神经网络解释牺牲了完备性与可解释性

机器学习 2025-03-20 v3 人工智能 计算机视觉与模式识别

摘要

神经网络(NNs)的高质量解释应具备两个关键属性。完备性确保它们准确反映网络的功能,可解释性使它们易于被人理解。许多现有方法提供网络内单个神经元的解释。在这项工作中,我们提供证据表明,对于在 ImageNet 上预训练的 AlexNet,与激活主成分相比,基于神经元的解释方法在完备性和可解释性上均有所牺牲。神经元是 AlexNet 嵌入的糟糕基,因为它们未能考虑这些表示的分布式本质。通过考察两种完备性的定量度量并开展用户研究以衡量可解释性,我们表明最重要的主成分比最重要的神经元提供了更完备且更可解释的解释。激活方差的很大一部分可通过考察相对较少的高方差主成分(PCs)来解释,而非研究每一个神经元。这些主成分也强烈影响网络功能,并且显著比神经元更具可解释性。我们的发现表明,针对如 AlexNet 等网络的解释方法应避免使用神经元作为嵌入的基,而应选择一个如主成分般考虑了网络内部表示的高维与分布式本质的基。交互式演示与代码见 https://ndey96.github.io/neuron-explanations-sacrifice。

关键词

引用

@article{arxiv.2011.03043,
  title  = {Neuron-based explanations of neural networks sacrifice completeness and interpretability},
  author = {Nolan Dey and Eric Taylor and Alexander Wong and Bryan Tripp and Graham W. Taylor},
  journal= {arXiv preprint arXiv:2011.03043},
  year   = {2025}
}

备注

TMLR 2025