中文

测试时间缩放的强化学习教师

机器学习 2025-10-30 v3 人工智能 计算与语言

摘要

使用强化学习 (RL) 训练具有单热正确性的推理语言模型,本质上依赖于该语言模型在初始化时能够以一定概率探索并解决其任务。此外,推理语言模型的一个关键用例是作为教师来蒸馏新的学生模型并冷启动未来的 RL 迭代,而不是直接部署它们自身。基于这些考虑,我们引入了一个新框架,通过训练一类新的强化学习教师 专注于产生最有效的下游蒸馏,从而避免了 RL 的探索挑战。RLT 被同时提供每个问题的问题和解答作为提示,并 tasked to simply "connect-the-dots" with detailed explanations tailored for their students. 我们通过将每个解释输入给学生模型并测试其对问题解答的理解来获取密集奖励,以此训练 RLT。在实践中,7B RLT 的原始输出在竞赛和研究生级别任务上提供的最终性能,优于那些收集并后处理大数倍语言模型推理轨迹的现有蒸馏和冷启动流水线。此外,当训练更大的学生模型以及零样本应用于分布外任务时,RLT 仍保持其有效性,这为 RL 推理框架解锁了新的效率和可重用性水平。代码可在以下地址获取:https://github.com/SakanaAI/RLT

关键词

引用

@article{arxiv.2506.08388,
  title  = {Reinforcement Learning Teachers of Test Time Scaling},
  author = {Edoardo Cetin and Tianyu Zhao and Yujin Tang},
  journal= {arXiv preprint arXiv:2506.08388},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025