神经元以范围表达:摆脱离离散神经元归因
机器学习
2026-04-13 v3 人工智能
计算与语言
摘要
大型语言模型(LLM)中普遍存在的多义性,削弱了神经元-概念的离散归因,成为模型解释与控制的重要挑战。我们系统性地分析了基于编码器和解码器的 LLM,并在多样化数据集上进行观察,发现即便是针对特定语义概念高度显著的神经元,也持续表现出多义性行为。重要的是,我们发现了一个一致模式:概念条件化的神经元激活幅度形成具有鲜明特征、常呈高斯分布的分布,且重叠最小。基于此观察,我们假设,通过解释和干预概念特定的激活范围,可以实现对 LLM 更精确的解释与目标化操控。为此,我们引入了 NeuronLens——一种基于范围的新型解释与操控框架,将概念归因局部化到神经元内的激活范围内。广泛的实证评估表明,基于范围的干预能够有效操控目标概念,同时显著降低了对辅助概念及整体模型性能的不良影响。
引用
@article{arxiv.2502.06809,
title = {Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution},
author = {Muhammad Umair Haider and Hammad Rizwan and Hassan Sajjad and Peizhong Ju and A. B. Siddique},
journal= {arXiv preprint arXiv:2502.06809},
year = {2026}
}