揭秘大语言模型中的长链思维推理
计算与语言
2025-02-06 v1 机器学习
摘要
扩展推理计算增强了大语言模型(LLMs)的推理能力,其中长链思维(CoTs)能够实现回溯和纠错等策略。强化学习(RL)已成为发展这些能力的关键方法,然而长链思维出现的条件仍不明确,且RL训练需要谨慎的设计选择。在本研究中,我们系统地研究了长链思维推理的机制,识别了使模型能够生成长链思维轨迹的关键因素。通过广泛的监督微调(SFT)和RL实验,我们提出了四个主要发现:(1) 虽然SFT并非严格必要,但它简化了训练并提高了效率;(2) 推理能力倾向于随着训练计算量的增加而涌现,但其发展并非必然,这使得奖励塑造对于稳定链思维长度增长至关重要;(3) 扩展可验证的奖励信号对RL至关重要。我们发现,利用带有过滤机制的、从网络提取的含噪解决方案显示出强大的潜力,特别是对于分布外(OOD)任务,如STEM推理;(4) 核心能力如纠错是基础模型固有的,但通过RL为复杂任务有效激励这些技能需要大量的计算,并且衡量其涌现需要一种细致入微的方法。这些见解为优化训练策略以增强LLMs中的长链思维推理提供了实践指导。我们的代码可在以下链接获取:https://github.com/eddycmu/demystify-long-cot。
引用
@article{arxiv.2502.03373,
title = {Demystifying Long Chain-of-Thought Reasoning in LLMs},
author = {Edward Yeo and Yuxuan Tong and Morry Niu and Graham Neubig and Xiang Yue},
journal= {arXiv preprint arXiv:2502.03373},
year = {2025}
}
备注
Preprint, under review