中文

NEAT:面向概念驱动的大语言模型神经元归因

计算与语言 2025-08-25 v1 人工智能 机器学习

摘要

定位负责最终预测的神经元对于打开大语言模型的黑箱结构并理解内部机制至关重要。以往研究尝试在神经元层面寻找机制,但这些方法未能有效代表概念,也存在进一步优化计算需求的潜在空间。本文借助概念向量,我们提出一种用于定位负责表示特定概念的关键神经元的方法,称这些神经元为概念神经元。若神经元数量为 n,示例数量为 m,则相较于前期工作,我们将正向传播所需次数从 O(n*m) 降低至仅 O(n),从而优化了所需时间和计算资源。我们还与多个基线方法和先前方法进行比较,结果表明我们的方法在大多数方法上表现更佳,且在与最新方法比较时更为高效。我们在消融研究中,还尝试通过引入聚类方法来优化概念神经元的搜索。最后,我们应用所提方法寻找并关闭这些神经元,对其对仇恨言论和偏见的影响进行分析,并就印度语境下的偏见问题进行评估。我们的 methodology、analysis 和 explanations 有助于理解神经元层面的责任归属,以便更广泛的人类概念,同时为未来寻找概念神经元并干预其作用指明了道路。

关键词

引用

@article{arxiv.2508.15875,
  title  = {NEAT: Concept driven Neuron Attribution in LLMs},
  author = {Vivek Hruday Kavuri and Gargi Shroff and Rahul Mishra},
  journal= {arXiv preprint arXiv:2508.15875},
  year   = {2025}
}