中文

Warm Up Before You Train: Unlocking General Reasoning in Resource-Constrained Settings

人工智能 2026-02-02 v3 计算与语言

摘要

设计有效的推理能力 LLM 通常需要使用可验证奖励的强化学习(RLVR)或依靠精心挑选的长链思维(CoT)蒸馏训练,这两者都高度依赖大量训练数据。这在训练数据有限的情况下构成了主要挑战。我们提出一种在受限监督下开发推理 LLM 的样本高效的两阶段训练策略。在第一个阶段,我们通过蒸馏来自玩具领域——骑士与守卫(K&K)逻辑谜题中的长 CoT,来获取通用推理技能。在第二个阶段,我们使用有限的目标域示例对已预热的模型应用 RLVR。我们的实验表明,这两种方法具有多个好处:(i)预热阶段本身可促进通用推理,导致在 MATH、HumanEval+^{+}和 MMLU-Pro 等多个任务上的性能提升;(ii)当基础模型和预热模型都在相同的小数据集(100\leq100 个示例)上进行 RLVR 训练时,预热模型始终优于基础模型;(iii)在 RLVR 训练后,预热模型仍能保持跨域的通用可塑性,即使是在特定领域训练后也能保持跨域推理能力;(iv)在预热管道中引入预热,不仅提高准确率,还提高了 RLVR 训练期间的整体样本效率。本文的结果凸显了在数据稀缺环境中构建稳健推理 LLM 的前景。

关键词

引用

@article{arxiv.2505.13718,
  title  = {Warm Up Before You Train: Unlocking General Reasoning in Resource-Constrained Settings},
  author = {Safal Shrestha and Minwu Kim and Aadim Nepal and Anubhav Shrestha and Keith Ross},
  journal= {arXiv preprint arXiv:2505.13718},
  year   = {2026}
}

备注

Accepted to EMNLP 2025