神经 FOXP2——面向 LLM 中目标语言改进的语言特定神经元驭向
计算与语言
2026-02-03 v1 人工智能
摘要
大语言模型(LLM)天然是多语言的,但其常用语言是英语,这反映了英语在预训练中的主导地位。其他语言虽存于参数记忆中,但被系统性地压制。我们认为语言默认性由稀疏低秩控制电路——语言神经元——支配,可被机械隔离并安全驭向。我们提出 Neural FOXP2,通过驭向语言特定神经元使所选语言(印地语或西班牙语)成为主语。Neural FOXP2 包含三个阶段:(i)局部化:我们训练每个层的稀疏激活分解(SAE),使每个激活分解为少数活跃特征组件。对于每个特征,我们量化英语与印地语/西班牙语的选择性,综合 logit 质量推向目标语言词汇集合。将排名最高的特征追溯到其最强贡献单元,得到一组紧凑的语言神经元。(ii)驭向方向:我们通过谱低秩分析局部化可控语言转换几何。对于每个层,我们构建英语到目标激活差异矩阵并进行层级 SVD,以提取支配语言变化的主导奇异方向。特征谱和有效秩谱识别出紧凑的驭向子空间和经验选择的干预窗口(这些方向最强且最稳定)。(iii)驭向:我们对语言神经元施加带符号的稀疏激活偏移。具体而言,在低到中层,我们沿目标语言主导方向施加正向驭向,并对英语神经元施加抵消性负向偏移指向零空间,实现可控的目标语言默认性。
引用
@article{arxiv.2602.00945,
title = {Neural FOXP2 -- Language Specific Neuron Steering for Targeted Language Improvement in LLMs},
author = {Anusa Saha and Tanmay Joshi and Vinija Jain and Aman Chadha and Amitava Das},
journal= {arXiv preprint arXiv:2602.00945},
year = {2026}
}