中文

学习强化学习无法实现的事情:交叉式在线微调以应对最难问题

人工智能 2026-03-12 v3 机器学习

摘要

最近的大型语言模型(LLM)推理进展表明,通过强化学习(RL)可以引发规划和自反思等高级行为。然而,尽管有这些成功,RL 目前的形式仍不足以诱导超出基础模型局限的能力,因为它主要基于模型现有知识进行优化,而非促进新信息的获取。为此,我们采用监督式微调(SFT)来学习 RL 无法实现的事情,这使我们能够通过利用高质量演示数据来纳入新知识和推理模式。我们分析了 RL 和 SFT 在 LLM 推理中的训练动力学,发现 RL 在维持和改进模型原有能力范围内问题的表现方面卓越,而 SFT 在促进超出当前模型范围之外的问题方面更为有效。基于 RL 和 SFT 的互补优势,我们提出了一种新颖的训练方法,ReLIFT(Reinforcement Learning Interleaved with Online Fine-Tuning)。在 ReLIFT 中,模型主要使用 RL 进行训练,但当遇到具有挑战性的问题时,收集高质量解答进行微调,训练过程在 RL 与微调之间交替,以提升模型的推理能力。ReLIFT 在五个竞赛水平基准测试和一个离分布基准测试上比其他零 RL 模型实现平均超过 5.2 分的提升。此外,我们展示了 ReLIFT 在仅使用 13% 的详细演示数据的情况下,既优于 RL 也优于 SFT,凸显了其可扩展性。这些结果为 ReLIFT 克服 RL 根本性局限提供了有说服力的证据,进而凸显了其巨大的潜力。

关键词

引用

@article{arxiv.2506.07527,
  title  = {Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions},
  author = {Lu Ma and Hao Liang and Meiyi Qiang and Lexiang Tang and Xiaochen Ma and Zhen Hao Wong and Junbo Niu and Chengyu Shen and Runming He and Yanhao Li and Bin Cui and Wentao Zhang},
  journal= {arXiv preprint arXiv:2506.07527},
  year   = {2026}
}

备注

12 pages, 5 figures