中文

基于同行成功与失败的多 rollout 在策略微调

机器学习 2026-05-14 v1 人工智能

摘要

大型语言模型通常使用稀疏验证器奖励进行后训练,这些奖励仅指示抽样轨迹是否成功,但对推理中哪里成功或失败缺乏足够指导。在策略微调(On-Policy Distillation, OPD)中,通过训练于学生生成的轨迹来获得更稠密的 token 级监督,但现有方法通常独立地对每个 rollout 进行微调,忽略了同一提示下的其他尝试。在本文中,我们引入了多 rollout 在策略微调(Multi-Rollout On-Policy Distillation, MOPD),这是一种利用学生本地 rollout 组合构建更具信息性教师信号的同行条件化微调框架。MOPD 条件化地依赖成功和失败的同行 rollout:成功提供有效推理模式的正面证据,而失败提供有结构的负面证据,指示应避免的合理错误。我们研究了两种同行上下文构建方式:正向同行模仿和对比成功-失败条件化。在竞赛编程、数学推理、科学问答和工具使用基准测试上进行实验,表明 MOPD 在标准策略基线上 consistently 获得改进。进一步的教师信号分析显示,混合成功-失败上下文更好地将教师分数与验证器奖励对齐,表明收益源于更忠实、按实例自适应的监督。这些结果表明,有效的策略微调应利用学生的多 rollout 试错行为,而非将 rollout 视为独立样本。

关键词

引用

@article{arxiv.2605.12652,
  title  = {Multi-Rollout On-Policy Distillation via Peer Successes and Failures},
  author = {Weichen Yu and Xiaomin Li and Yizhou Zhao and Xiaoze Liu and Ruowang Zhang and Haixin Wang and Yinyi Luo and Chen Henry Wu and Gaurav Mittal and Matt Fredrikson and Yu Hu},
  journal= {arXiv preprint arXiv:2605.12652},
  year   = {2026}
}

备注

23 pages