CRANE:多语言大语言模型中语言特异性神经元的因果相关性分析
计算与语言
2026-03-11 v2 人工智能
摘要
多语言大语言模型(LLM)在不同语言上均取得了优异的性能,然而其语言能力在神经元层面是如何组织的仍知之甚少。先前的工作主要通过基于激活的启发式方法来识别语言相关神经元,这将语言偏好与功能重要性混为一谈。我们提出了 CRANE,一个基于相关性的分析框架,它从功能必要性的角度重新定义了语言特异性,并通过针对性的神经元级干预来识别语言特异性神经元。CRANE 通过神经元对条件化语言预测的贡献来表征其特化程度,而非依据激活幅度。我们的实现将公开发布。神经元级干预揭示了一致的非对称模式:掩蔽与目标语言相关的神经元会选择性地降低该语言上的性能,同时在很大程度上保持其他语言上的性能,这表明神经元的特化具有语言选择性但非排他性。在多个基准测试上对英语、中文和越南语进行的实验,结合专用的基于相关性的指标以及从基础模型到对话模型的迁移分析,表明 CRANE 比基于激活的方法更精确地分离出了语言特异性组件。
引用
@article{arxiv.2601.04664,
title = {CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models},
author = {Yifan Le and Yunliang Li},
journal= {arXiv preprint arXiv:2601.04664},
year = {2026}
}
备注
10 pages, 6 figures. Work in progress