神经元经验梯度:发现与量化神经元全局线性可控性
计算与语言
2025-06-03 v3 人工智能
摘要
虽然前馈神经元在预训练语言模型(PLMs)中可以编码知识,但过去的研究仅针对少数对输出影响较大的神经元,这留下了神经元激活在更广泛范围内的作用尚不清晰,限制了诸如知识编辑等领域的进展。我们通过对知识探针数据集进行神经元干预,发现神经元激活与输出之间存在全局线性关系。我们称这种线性关系的梯度为神经元经验梯度(Neuron Empirical Gradient, NEG),它捕捉了激活变化如何影响预测的含义。为高效计算 NEG,我们提出了 NeurGrad,使我们能够对预训练语言模型中的神经元行为进行大规模分析。我们还展示了 NEG 能否通过技能神经元探针跨越 diverse prompts 捕捉语言技能。MCEval8k 多体裁多选知识基准的实验支持 NEG 能代表模型知识的能力。进一步的分析突显了 NEG 基于技能表示的关键属性:高效性、鲁棒性、灵活性和相互依赖性。我们发布了代码和数据。
引用
@article{arxiv.2412.18053,
title = {Neuron Empirical Gradient: Discovering and Quantifying Neurons Global Linear Controllability},
author = {Xin Zhao and Zehui Jiang and Naoki Yoshinaga},
journal= {arXiv preprint arXiv:2412.18053},
year = {2025}
}
备注
Accepted to ACL 2025 Main, 32 pages