带计划引导的选择性离策略参考调优
人工智能
2026-05-14 v2
摘要
使用可验证奖励的强化学习有助于推理,但GRPO风格的方法在困难提示上会停滞不前,因为所有采样的推理轨迹都失败了。SORT为这些失败添加了一个修复更新,而不改变轨迹生成过程:它从参考解中推导出一个计划,比较有该计划和无该计划时的词元概率,并对在计划条件下变得更可预测的词元赋予更高权重。这将全错提示转化为选择性的、结构感知的学习信号,而非均匀模仿。在三个骨干模型和八个推理基准上,SORT相比GRPO和引导基线均有提升,且在较弱模型上增益最大。
引用
@article{arxiv.2605.11505,
title = {Selective Off-Policy Reference Tuning with Plan Guidance},
author = {Duc Anh Le and Tien-Phat Nguyen and Thien Huu Nguyen and Linh Ngo Van and Trung Le},
journal= {arXiv preprint arXiv:2605.11505},
year = {2026}
}