基于正-未标记强化学习蒸馏的本地小模型
机器学习
2026-01-29 v1
摘要
由于隐私、成本和延迟的限制,本地部署小模型日益常见。然而,大多数实际管道仅进行监督微调(SFT),难以达到强化学习(RL)对齐阶段。主要原因在于,RL对齐通常需要昂贵的人类偏好标注,或高度依赖大规模API调用和持续工程维护的高质量奖励模型,这些都不适用于本地环境。为弥合这一差距,我们提出一种用于本地小模型部署的正-未标记(PU)RL蒸馏方法。该方法无需人类标注的偏好或奖励模型,即可将教师从黑盒生成中提炼偏好优化能力到可本地训练的学生。对于每个提示,我们仅查询教师一次获取锚定响应,本地采样多个学生候选方案,并执行锚定条件自排序,以诱导两两或列表偏好,实现完全本地的训练循环,通过直接偏好优化或群体相对策略优化。理论分析表明,我们的方法所诱导的偏好信号是一致有序的,并集中在接近最优的候选方案上,支持其在偏好优化中的稳定性。实验结果显示,在低成本环境下,该方法始终表现出色。
引用
@article{arxiv.2601.20687,
title = {Positive-Unlabeled Reinforcement Learning Distillation for On-Premise Small Models},
author = {Zhiqiang Kou and Junyang Chen and Xin-Qiang Cai and Xiaobo Xia and Ming-Kun Xie and Dong-Dong Wu and Biao Liu and Yuheng Jia and Xin Geng and Masashi Sugiyama and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2601.20687},
year = {2026}
}
备注
22 pages, 8 figures, 7 tables