中文

三重相变:从神经科学视角理解大型语言模型的学习动态

计算与语言 2025-04-01 v2 人工智能 机器学习 神经元与认知

摘要

大型语言模型(LLMs)常表现出突发的涌现行为,即在训练过程中的特定时刻出现新能力。这种现象通常被称为“相变”,目前仍缺乏深入理解。在本研究中,我们通过考察三个相互关联的视角对这种相变进行了综合分析:LLMs 与人脑的相似性、LLMs 的内部状态以及下游任务性能。我们对在训练数据和架构上均有所不同的 LLMs 的学习动态提出了一种新颖的解释,揭示了这些模型在训练期间通常会涌现三次相变:(1)随着 LLMs 开始遵循任务指令,其与全脑的相似性激增——大脑对齐与指令遵循;(2)出乎意料的是,在下游任务准确率暂时停滞的时期,LLMs 与大脑发生偏离——大脑偏离与停滞;(3)随着 LLMs 具备解决下游任务的能力,其与大脑的相似性再次出现——大脑重新对齐与巩固。这些发现阐明了 LLMs 中相变的底层机制,同时为连接 AI 与神经科学的跨学科研究开辟了新途径。

关键词

引用

@article{arxiv.2502.20779,
  title  = {Triple Phase Transitions: Understanding the Learning Dynamics of Large Language Models from a Neuroscience Perspective},
  author = {Yuko Nakagi and Keigo Tada and Sota Yoshino and Shinji Nishimoto and Yu Takagi},
  journal= {arXiv preprint arXiv:2502.20779},
  year   = {2025}
}

备注

46 pages