中文

统一的 On-Policy 蒸馏框架:基于双视角配方的 Uni-OPD

机器学习 2026-05-06 v1

摘要

On-policy 蒸馏(OPD)最近作为一种有效的训练后范式,被用于将专用专家模型的能力整合到单个学生模型中。尽管已有实证成功,但导致 OPD 可靠改进的条件仍鲜有了解。本文我们识别出两种根本性瓶颈限制有效 OPD:对信息性状态的探索不足以及对学生 rollout 的教师监督不可靠。基于此洞见,我们提出 Uni-OPD,一个跨大语言模型(LLM)和多模态大语言模型(MLLM)的统一 OPD 框架,核心为双视角优化策略。具体而言,从学生视角,我们采用两种数据平衡策略以促进训练期间对信息性学生生成状态的探索。从教师视角,我们表明可靠监督取决于聚合的 token 级指导是否与结果奖励保持顺序一致。为此,我们开发了基于结果的边际校准机制,以恢复正确与错误轨迹之间的顺序一致性。我们在 5 个领域和 16 个基准上进行大规模实验,涵盖单教师与多教师蒸馏、强到弱蒸馏以及跨模态蒸馏等多种设置。我们的结果验证了 Uni-OPD 的有效性和通用性,并为可靠的 OPD 提供了实用见解。

关键词

引用

@article{arxiv.2605.03677,
  title  = {Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe},
  author = {Wenjin Hou and Shangpin Peng and Weinong Wang and Zheng Ruan and Yue Zhang and Zhenglin Zhou and Mingqi Gao and Yifei Chen and Kaiqi Wang and Hongming Yang and Chengquan Zhang and Zhuotao Tian and Han Hu and Yi Yang and Fei Wu and Hehe Fan},
  journal= {arXiv preprint arXiv:2605.03677},
  year   = {2026}
}