中文

硅基中的朋友与祖母:语言模型中的实体单元定位

计算与语言 2026-05-19 v2 人工智能

摘要

语言模型如何从参数中检索实体特定的事实?我们通过搜索稀疏的、实体选择性的 MLP 神经元——我们称之为实体单元,类比于神经科学中的"祖母细胞"假说——并测试它们在事实回忆中是否发挥因果作用来研究这一问题。我们通过对同一实体的不同提示下 MLP 神经元激活一致性进行排序来定位候选实体单元,并在七个模型上对 PopQA 的一个精选子集应用该程序。在所有模型中,定位到的神经元主要聚集在早期层,这一经验模式并非由架构所强加。以 Qwen2.5-7B base 作为模型生物,我们发现了最明确的因果证据:抑制一个定位单元会选择性地擦除其匹配实体的事实回忆,同时保持其他实体完好,而激活单个单元足以恢复大多数实体的正确知识——即使该实体不在上下文中。相同的单元在别名、缩写、拼写错误和多语言表面形式下均能被恢复,并且在指令微调后保持稳定,这表明它们编码的是规范实体身份而非表面标记模式。因果信号在不同模型族之间存在差异,指出了实体知识在架构组织方式上的差异。这些发现为理解和控制语言模型中的事实知识提供了具体、可解释的切入点,并在神经科学关于概念稀疏编码的长期问题上建立了一个令人惊讶的实证平行。

关键词

引用

@article{arxiv.2604.01404,
  title  = {Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models},
  author = {Itay Yona and Dan Barzilay and Michael Karasik and Mor Geva},
  journal= {arXiv preprint arXiv:2604.01404},
  year   = {2026}
}