够不够?探讨 SFT 与 RL 在提升 LLM 推理能力中的相互作用
人工智能
2025-06-02 v1
摘要
大型语言模型 (LLM) 的最新突破显著提高了其在数学和逻辑问题上的推理能力,这类问题具有可验证的答案,常通过监督微调 (SFT) 和强化学习 (RL) 等技术实现。先前的研究表明,RL 有效内化搜索策略,使 LLM 能够进行长链式思维 (CoT) 推理,回溯 (backtracking) 能力随之自然涌现。然而,回溯的具体收益——即其对推理提升的贡献程度以及其使用的最佳范围——仍然鲜有了解。本文系统性地研究了 SFT 与 RL 在八个推理任务上的动态关系,包括 Countdown、Sudoku、Arc 1D、Geometry、Color Cube Rotation、List Functions、Zebra Puzzles 和 Self Reference。我们的发现表明,SFT 中用于热身的短 CoT 序列相对于 cold-start RL 具有中等贡献;但随着任务难度增加,这种贡献逐渐减弱。基于此观察,我们构建了包含不同回溯步骤数的合成数据集,并进行受控实验以隔离内容正确性或结构(即回溯频率)的影响。我们发现: (1) 较长的带回溯的 CoT 通常能引发更好的且更稳定的 RL 训练; (2) 较难的任务具有更大的搜索空间, tends to 需要更多回溯步骤来进行 SFT 阶段。此外,我们通过蒸馏数据实验表明,RL 训练对长 CoT 序列的正确性影响不大,表明 RL 更关注结构模式而非内容正确性。总体而言,我们的结果为设计有效的训练策略以有效扩展 LLM 推理能力提供了实用见解。
引用
@article{arxiv.2505.24273,
title = {How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning},
author = {Hongyi James Cai and Junlin Wang and Xiaoyin Chen and Bhuwan Dhingra},
journal= {arXiv preprint arXiv:2505.24273},
year = {2025}
}