中文

TMS:基于轨迹混合监督的奖励-free、在策略上的 SFT

机器学习 2026-02-04 v1

摘要

强化学习 (RL) 和监督微调 (SFT) 是增强大型语言模型 (LLM) 在下游任务上性能的两种主导范式。虽然 RL 在保留更广泛模型能力方面优于 SFT,但伴随着显著成本:复杂的奖励工程、不稳定性和高昂的在策略采样成本。相比之下,SFT 高效但脆弱,常因 \textbf{监督不匹配} (即模型演化策略与静态训练标签之间的差异) 导致灾难性遗忘。我们通过 \textbf{轨迹混合监督 (TMS)} 来解决这一权衡,这是一个无需奖励的框架,通过创建来自模型自身历史检查点的动态课程来模拟 RL 的在策略优势。TMS 最小化 \textit{策略-标签偏差 (PLD)},防止标准 SFT 中模式坍缩导致的遗忘。实验在推理 (MATH、GSM8K) 和指令跟随基准上表明,TMS 有效地移动了准确率-保留的 Pareto 前沿。虽然 RL 在保留方面仍是黄金标准,但 TMS 在标准和迭代 SFT 上显著优于后者,无需奖励模型或验证器即可缩小与 RL 的差距。机制分析确认 PLD 漂移准确预测遗忘,TMS 成功地缓解了这一漂移。

关键词

引用

@article{arxiv.2602.03073,
  title  = {TMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFT},
  author = {Rana Muhammad Shahroz Khan and Zijie Liu and Zhen Tan and Charles Fleming and Tianlong Chen},
  journal= {arXiv preprint arXiv:2602.03073},
  year   = {2026}
}