LLM慢思考的显现:逆树冻结视角
人工智能
2026-05-08 v3 无序系统与神经网络
统计力学
机器学习
物理与社会
摘要
基于可验证奖励的强化学习(RLVR)使大型语言模型(LLM)能够从稀疏的最终答案信号中获得慢速、多步骤推理能力。我们提供了一个统计物理视角来解释这种显现。我们展示,自回归模型的有限容量迫使其将指数级的前缀空间压缩为一组预测状态的马尔可夫网络,其中慢速思考表现为随机游走——即概念网络(CoNet)图景。在CoNet中,RLVR动力学由两种机制支配:兼容路径的合并与不兼容路径的受挫竞争。它们共同驱动网络经历核化、增长和冻结,形成多输入、单输出的有向逆树结构。该图景再现了15亿参数LLM的训练动力学,并得出三个预测:推理链的长度是稀疏拓扑的几何必然;SFT( supervised fine-tuning)通过桥接节点断裂引发灾难性遗忘;挫折驱动策略崩溃。基于逆树冻结中固有的结构性时机,我们提出了Annealed-RLVR——一种在最大挫折时刻进行的简短SFT干预。它在both in-和 out-of-distribution基准测试中超越标准RLVR,最大收益在于高采样预算处,而标准RLVR在此处会崩溃。将相同的SFT在树冻结后应用,反而触发灾难性遗忘,确认时机是活跃因素。
引用
@article{arxiv.2509.23629,
title = {Emergent Slow Thinking in LLMs as Inverse Tree Freezing},
author = {Sihan Hu and Xiansheng Cai and Yuan Huang and Zhiyuan Yao and Linfeng Zhang and Pan Zhang and Youjin Deng and Kun Chen},
journal= {arXiv preprint arXiv:2509.23629},
year = {2026}
}
备注
34 pages, 17 figures, 1 table