中文

语言算术:迈向系统性的语言神经元识别与操控

计算与语言 2025-11-04 v3

摘要

大语言模型(LLM)展现出强大的多语言能力,然而语言特定处理背后的神经机制仍不清楚。我们分析了Llama-3.1-8B、Mistral-Nemo-12B以及Aya-Expanse-8B和32B中针对21种类型多样的语言的特定语言神经元,识别出控制语言行为的神经元。使用语言激活概率熵(LAPE)方法,我们表明这些神经元聚集在较深层,非拉丁文字表现出更高的专门化程度。相关语言共享重叠的神经元,反映了语言邻近性的内部表征。通过语言算术,即系统性的激活加法和乘法,我们引导模型停用不需要的语言并激活所需的语言,其性能优于简单的替换方法。这些干预措施有效地指导了五种多语言任务中的行为:语言强制、翻译、问答、理解和自然语言推理。对高资源语言的操控更为成功,而类型学相似性则提高了有效性。我们还展示了跨语言神经元引导增强了下游性能,并揭示了当神经元被逐步停用时,语言选择的内在“回退”机制。我们的代码已在https://github.com/d-gurgurov/Language-Neurons-Manipulation公开。

关键词

引用

@article{arxiv.2507.22608,
  title  = {Language Arithmetics: Towards Systematic Language Neuron Identification and Manipulation},
  author = {Daniil Gurgurov and Katharina Trinley and Yusser Al Ghussin and Tanja Baeumel and Josef van Genabith and Simon Ostermann},
  journal= {arXiv preprint arXiv:2507.22608},
  year   = {2025}
}

备注

accepted to AACL main