NeuronScope:用于解释语言模型中多义神经元的多智能体框架
计算与语言
2026-01-08 v1 机器学习
摘要
大型语言模型(LLM)中的神经元水平解释面临的根本性挑战在于广泛的多义性,即单个神经元响应多个不同语义概念。现有的单次解释方法难以忠实地捕捉这种多概念行为。本文提出了 NeuronScope,一种将神经元解释重新表述为迭代、由激活引导的过程的多智能体框架。NeuronScope 显式地将神经元激活分解为原子语义组件,聚类为 distinct 语义模式,并通过神经元激活反馈不断细化每一种解释。实验表明,NeuronScope 能发现隐藏的多义性,并产生的解释在激活相关性上显著高于单次基线方法。
引用
@article{arxiv.2601.03671,
title = {NeuronScope: A Multi-Agent Framework for Explaining Polysemantic Neurons in Language Models},
author = {Weiqi Liu and Yongliang Miao and Haiyan Zhao and Yanguang Liu and Mengnan Du},
journal= {arXiv preprint arXiv:2601.03671},
year = {2026}
}