中文

RAST:通过小模型迁移推动LLM推理激活

机器学习 2025-06-23 v1 人工智能

摘要

强化学习(RL)已成为提高大型语言模型(LLM)推理能力的强大方法,诸如OpenAI的o1和Deepseek-R1等近期成功均证明了这一点。然而,大规模应用RL仍令人难以置信,需多个模型副本和大量GPU资源。另一方面,尽管RL强大,但近期研究表明,RL并不为模型带来新知识;相反,它主要重塑模型的输出分布,以激活底层模型中潜在的推理能力。基于此洞察,我们假设RL引起的输出概率变化在模型规模上基本保持不变,为更高效的方法打开了可能性:使用RL训练一个小模型,并将其诱导的概率偏移迁移到更大的底层模型。为验证我们的假设,我们对解码轨迹进行逐token分析,发现RL引起的输出分布在不同模型规模间高度一致,验证了我们的假设。据此,我们提出RAST(Reasoning Activation via Small-model Transfer),一种简洁而有效的方法,通过将从小型RL训练模型中获得的概率调整注入更大模型,以实现推理行为的迁移。在多个数学推理基准测试中,RAST显著且一致地提升了底层模型的推理能力,所需GPU内存远低于直接RL训练,有时甚至能获得比RL训练模型更好的性能。我们的发现为理解RL驱动的推理本质及其规模化提供了新见解,同时为在不承担全部计算成本的情况下将其利益规模化提供了实用策略。RAST项目页面可在https://ozyyshr.github.io/RAST/访问。

关键词

引用

@article{arxiv.2506.15710,
  title  = {RAST: Reasoning Activation in LLMs via Small-model Transfer},
  author = {Siru Ouyang and Xinyu Zhu and Zilin Xiao and Minhao Jiang and Yu Meng and Jiawei Han},
  journal= {arXiv preprint arXiv:2506.15710},
  year   = {2025}
}