中文

分布式专化:大语言模型中稀有标记神经元

人工智能 2025-09-26 v1

摘要

大语言模型 (LLMs) 在表示和生成稀有标记方面存在困难,尽管这些标记在专业领域中至关重要。我们调查了 LLMs 是否通过离散模块化架构或分布式参数级差异化来发展内部专化机制。通过对多个模型家族中最终层 MLP 神经元进行系统性分析,我们发现稀有标记处理通过\textit{分布式专化}实现:功能上协调但在空间上分布的子网络,表现出三种不同的组织原则。首先,我们识别出一种可复现的三层次影响层级,包括高度影响的平台神经元(也称为稀有标记神经元)、幂律衰减神经元和最小贡献神经元,这一现象在普通标记处理中不存在。其次,平台神经元表现出协调的激活模式(减少有效维度),但保持空间分布,尚不形成离散聚类。第三,这些专化机制通过标准注意力路径普遍可访问,无需专门的路由电路。训练动力学揭示,功能专化通过参数差异化逐渐发展,专化神经元表现出越来越重尾的权重相关谱,符合重尾自正则化 (Heavy-Tailed Self-Regularization) 特征。我们的发现表明,LLMs 通过分布式协调而非混合专家风格的模块化处理稀有标记。这些结果为可解释模型编辑、计算效率优化以及理解 Transformer 网络中涌现功能组织提供了洞见。

关键词

引用

@article{arxiv.2509.21163,
  title  = {Distributed Specialization: Rare-Token Neurons in Large Language Models},
  author = {Jing Liu and Haozheng Wang and Yueheng Li},
  journal= {arXiv preprint arXiv:2509.21163},
  year   = {2025}
}