中文

大型语言模型超越任何语言的抽象思维的出现

计算与语言 2025-06-12 v1 人工智能

摘要

随着大型语言模型(LLM)的持续进步,其在多种语言中有效运作的能力已显示出显著提升。初步研究表明,LLM 的隐藏激活通常类似于英语,即使是在响应非英语提示时。这导致了广泛假设认为 LLM 可能"用英语思考"。然而,最近显示强大多语言性能的结果——甚至在特定任务上超越英语在其他语言上的表现——挑战了这一观点。在本文中,我们发现 LLM 逐步发展出一个核心语言无关的参数空间——一个参数数量极小的子集,其失活会导致在所有语言中性能显著下降。这个紧凑但关键的参数集支撑了模型超越单个语言进行泛化的能力,支持了不依赖于任何特定语言系统的抽象思维的出现。具体而言,我们识别了与语言相关的神经元——在处理特定语言时持续激活——并将它们分类为共享的(在多种语言中激活)或独有的(特定于一种语言)。随着 LLM 的持续发展,我们观察到共享神经元的比例和功能重要性显著增加,而独有神经元的 influence 逐渐减弱。这些共享神经元构成了核心语言无关参数空间的骨干,支持了抽象思维的出现。受这些洞察启发,我们提出了针对 LLM 在不同发展阶段语言无关层面的神经元特定训练策略。跨多种 LLM 家族的实验支持了我们的方法。

关键词

引用

@article{arxiv.2506.09890,
  title  = {The Emergence of Abstract Thought in Large Language Models Beyond Any Language},
  author = {Yuxin Chen and Yiran Zhao and Yang Zhang and An Zhang and Kenji Kawaguchi and Shafiq Joty and Junnan Li and Tat-Seng Chua and Michael Qizhe Shieh and Wenxuan Zhang},
  journal= {arXiv preprint arXiv:2506.09890},
  year   = {2025}
}