利用约束框架进行训练:面向复杂推理的在策略约束框架自蒸馏
计算与语言
2026-05-12 v1
摘要
推理时约束框架显著提升了大型语言模型在复杂推理任务上的表现。然而,底层模型的内在能力并未因这些外部工作流的添加而改变。为弥合这一差距,我们引入了“在策略约束框架自蒸馏”(OPHSD),该方法使用约束框架增强的当前模型作为自蒸馏的教师,从而从约束框架中引入超越训练数据的额外监督信号。OPHSD将任务特定的约束框架能力内化到学生模型中,在多种推理任务上产生了稳健的泛化能力和强大的独立性能。在用于文本分类的草稿-验证约束框架和用于数学推理任务的规划-求解约束框架上进行评估,OPHSD始终优于强基线(例如,在HMMT25上比OPSD高出+10.83%)。我们的分析进一步表明,在推理期间重新附加约束框架不会带来额外收益,甚至可能降低性能,这表明复杂的约束框架不必总是永久性的附加组件;相反,它们可以作为临时的训练支架,其益处被永久地反馈到基础模型中。我们的代码和训练数据可在https://github.com/zzy1127/OPHSD-On-Policy-Harness-Self-Distillation获取。
引用
@article{arxiv.2605.08741,
title = {Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning},
author = {Zhengyang Zhao and Lu Ma and Wentao Zhang},
journal= {arXiv preprint arXiv:2605.08741},
year = {2026}
}