ROSD:反思式策略自蒸馏:跨域语言模型推理
计算与语言
2026-05-28 v1 机器学习
摘要
策略自蒸馏(OPSD)通过为策略 rollout 提供稠密的 token 级监督,提高大语言模型(LLM)的推理性能。然而,现有 OPSD 方法在域内推理获益有限,且对域外问题的泛化能力较差。我们识别出两个关键原因:1)以验证解作为条件的自教师会鼓励模仿训练域参考轨迹,而非针对错误的特定纠正,2)将蒸馏应用到完整响应上会覆盖有效的推理前缀并强化过拟合。我们提出反思式策略自蒸馏(ROSD),一个将参考解模仿转化为针对性推理纠正的框架,通过 reflection-guided、error-localized distillation 实现。对于每个 rollout,ROSD 使用自反思器提取纠正想法并定位第一个错误片段。纠正想法引导自教师向针对性监督,局部化错误片段限制蒸馏仅限于需要纠正的区域。这种设计在纠正有缺陷的推理的同时保留有效的前缀。实验在多个域内和域外推理基准测试上表明,ROSD 在整体上实现更强的域内推理性能,同时在域外泛化方面显著优于标准 OPSD。代码可在 https://github.com/ZiqiZhao1/ROSD 获取。
引用
@article{arxiv.2605.28014,
title = {ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains},
author = {Ziqi Zhao and Xinyu Ma and Liu Yang and Yujie Feng and Daiting Shi and Jingzhou He and Xin Xin and Zhaochun Ren and Xiao-Ming Wu},
journal= {arXiv preprint arXiv:2605.28014},
year = {2026}
}
备注
Preprint