中文

LLM 训练中快思考与慢思考各层发生了什么:基于梯度的视角

计算与语言 2025-06-06 v2 人工智能 机器学习

摘要

LLM 的后训练中什么因素起了作用?我们从梯度的角度研究大型语言模型(LLM)中不同层的训练模式。我们特别关注快思考与慢思考如何影响逐层梯度,考虑到最近在推理路径(如思维链 CoT 和过程奖励)上训练 LLM 的流行趋势。在我们的研究中,不使用 CoT 的快思考导致更大的梯度以及层间梯度差异,而慢思考(详细 CoT)则带来了学习稳定性。此外,我们研究了梯度模式是否能够反映在使用慢思考与快思考路径训练不同 LLM 时响应的正确性。结果表明,慢思考的梯度可以区分正确和不相关的推理路径。作为对比,我们在非推理知识学习任务上进行了类似的梯度分析,然而在此类任务上简单增加响应长度并不会产生类似的慢思考行为。我们的研究加深了对 LLM 训练的基本理解,并为其效率和稳定性提供了新见解,为构建可泛化的 System-2 智能体铺平了道路。我们的代码、数据和梯度统计信息可在 https://github.com/MingLiiii/Layer_Gradient 获取。

关键词

引用

@article{arxiv.2410.23743,
  title  = {What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective},
  author = {Ming Li and Yanhong Li and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2410.23743},
  year   = {2025}
}

备注

ACL2025 main, Camera-ready