中文

基于评卷标准的策略性蒸馏

机器学习 2026-05-11 v1 人工智能

摘要

策略性蒸馏 (OPD) 是一种强大的模型对齐范式,但其对教师 logits 的依赖限制了其仅限于白盒场景。我们认为,结构化语义评卷标准可作为教师 logits 的可扩展替代方案,使 OPD 仅依赖于教师生成的响应即可实现。为证明这一观点,我们引入 ROPD,一个简单而基础的评卷标准驱动的 OPD 框架。具体而言,ROPD 从教师-学生对比中诱导出特定于提示的评卷标准,然后利用这些评卷标准对学生 rollout 进行评分,以实现策略优化。经验上,ROPD 在大多数场景下均优于先进的基于 logits 的 OPD 方法,实现了最高可达 10 倍的样本效率提升。这些结果将基于评卷的 OPD 定位为一种灵活、黑盒兼容的替代方案,为在专有和开源 LLM 之间进行可扩展蒸馏提供简单而强大的基线。代码已公开:https://github.com/Peregrine123/ROPD_official。

关键词

引用

@article{arxiv.2605.07396,
  title  = {Rubric-based On-policy Distillation},
  author = {Junfeng Fang and Zhepei Hong and Mao Zheng and Mingyang Song and Gengsheng Li and Houcheng Jiang and Dan Zhang and Haiyun Guo and Xiang Wang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2605.07396},
  year   = {2026}
}

备注

Preprint. Code is available at https://github.com/Peregrine123/ROPD_official