缺失概念激活的神经元:解释性研究
人工智能
2026-03-11 v1
摘要
可解释人工智能(XAI)旨在提供对深度神经网络(DNN)行为的人类可解释见解,通常通过估计模型的简化因果结构。 在现有工作中,这种因果结构通常包括概念存在与神经元强激活之间的关系。例如,归因方法主要识别对预测贡献最大的输入像素,特征可视化方法揭示导致目标神经元高激活的输入——前者隐式假设相关信息位于输入中,后者假设神经元编码概念的存在。然而,一种被大大低估的因果关系类型是编码的缺失关系,即概念的缺失会增加神经元激活。在本文中,我们展示了此类缺失但相关的概念相当常见,并且主流XAI方法在标准形式下难以揭示它们。为此,我们提出了两种简单的归因和特征可视化技术的扩展方法,以揭示编码的缺失。通过实验,我们展示了主流XAI方法可用于揭示和解释编码的缺失,ImageNet模型如何利用它们,以及在考虑它们的情况下如何改进去偏置。
引用
@article{arxiv.2603.09786,
title = {Quantifying the Necessity of Chain of Thought through Opaque Serial Depth},
author = {Jonah Brown-Cohen and David Lindner and Rohin Shah},
journal= {arXiv preprint arXiv:2603.09786},
year = {2026}
}