中文

选择-假设-验证:面向经验证的神经元概念解释

计算机视觉与模式识别 2026-03-27 v1

摘要

解释神经网络决策的关键在于理解神经元的功能(即概念)。现有方法通过生成自然语言描述来表征神经元概念,从而推进对神经网络决策机制的理解。然而,这些方法假设每个神经元都有明确的功能,并为神经网络决策提供判别性特征。事实上,某些神经元可能是冗余的,或提供误导性的概念。因此,这些神经元的描述可能导致对驱动神经网络决策的因素产生误解。为此,我们引入神经元功能的验证,即检查生成的概念是否高度激活相应的神经元。进一步,我们提出了 Select-Hypothesize-Verify 框架,用于解释神经元功能。该框架包括:1)通过激活分布分析选择能最佳捕捉神经元明确功能行为的激活样本;2)为所选神经元形成概念假设;3)验证生成的概念是否准确反映神经元的功能。大量实验表明,我们的方法能产生更准确的神经元概念。我们的生成概念能相应激活神经元的概率约为当前最先进方法的 1.5 倍。

关键词

引用

@article{arxiv.2603.24953,
  title  = {Select, Hypothesize and Verify: Towards Verified Neuron Concept Interpretation},
  author = {ZeBin Ji and Yang Hu and Xiuli Bi and Bo Liu and Bin Xiao},
  journal= {arXiv preprint arXiv:2603.24953},
  year   = {2026}
}

备注

Accepted in CVPR 2026