转移神经元假设:多语言 LLM 中语言潜在空间转换的内在机制
计算与语言
2025-09-23 v1 人工智能
机器学习
摘要
最近的研究表明,解码器式大语言模型(LLM)处理多语言输入的框架为:前层将输入转换为以英语为中心且语言无关的表示;中层在以英语为中心的潜在空间中进行推理;最终层通过将这些表示转换回语言特定的潜在空间来生成输出。然而,这种转换的内部动态以及其背后的机制仍未得到充分探索。为更深入地理解这一框架,本文提出并经验验证了“转移神经元假设”:MLP 模块中的某些神经元负责在语言特定潜在空间和共享语义潜在空间之间传输表示。此外,我们展示了语言特定神经元的一种功能是促进潜在空间之间的运动。最后,我们表明,转移神经元对多语言 LLM 的推理至关重要。
引用
@article{arxiv.2509.17030,
title = {The Transfer Neurons Hypothesis: An Underlying Mechanism for Language Latent Space Transitions in Multilingual LLMs},
author = {Hinata Tezuka and Naoya Inoue},
journal= {arXiv preprint arXiv:2509.17030},
year = {2025}
}
备注
57 pages, 47 figures and 41 tables; Accepted to EMNLP 2025 Main