推理的动力学:链条思维如何塑造变换器中的学习?
机器学习
2025-10-31 v1 人工智能
摘要
链条思维(Chain-of-Thought, CoT)监督可以显著提高变换器性能,但模型如何学习遵循并从链条思维中获益,仍然鲜为人知。我们通过将变换器在可调算法复杂度和可控数据组成的符号推理任务上预训练,以“磨化”(grokking)的视角研究这些学习动力学。在两种训练设置下进行训练:(i)仅生成最终答案,(ii)在回答前发出明确的链条思维痕迹。我们的结果表明,链条思维通常会提高任务性能,但其收益取决于任务复杂度。为量化这些影响,我们用三参数 logistic 曲线建模对数训练步骤的准确率,揭示了学习速度和形状如何随任务复杂度、数据分布以及链条思维监督的存在而变化。我们还发现一种暂时性痕迹不忠实相位:在训练初期,模型常常在生成正确答案的同时跳过或矛盾链条思维步骤,随后再对齐其推理痕迹与答案。经验上,我们(1)展示了链条思维加速了泛化,但并未克服如查找列表交叉等更高算法复杂度的任务;(2)引入了理解变换器学习动力学的动力学建模框架;(3)将痕迹忠实性刻画为随训练而出现的动态属性;(4)表明链条思维在机制上改变了变换器的内部计算。
引用
@article{arxiv.2510.25791,
title = {The Kinetics of Reasoning: How Chain-of-Thought Shapes Learning in Transformers?},
author = {Zihan Pengmei and Costas Mavromatis and Zhengyuan Shen and Yunyi Zhang and Vassilis N. Ioannidis and Huzefa Rangwala},
journal= {arXiv preprint arXiv:2510.25791},
year = {2025}
}
备注
10 pages, 7 figures, with appendix