不仅传递数据,更传递奖励:小型语言模型能否超越大型语言模型?
计算与语言
2025-02-28 v1 人工智能
摘要
大型语言模型(LLM)的蒸馏通常涉及通过监督式微调(SFT)传递教师模型的响应。然而,这种方法忽视了同时传递数据(输出内容)和奖励信号(质量评估)的潜在价值。直接从教师模型提取可靠奖励信号具有挑战性,因为LLM为生成而非评估优化,常导致偏差或不一致的评估。为此,我们提出一种新型蒸馏管线,同时传递响应与奖励。该方法通过自监督机制生成伪奖励,利用教师与学生响应的内在结构,实现无需显式外部评估的奖励学习。随后,奖励模型指导强化学习(RL),允许在SFT预热阶段后持续迭代优化学生模型。GSM8K和MMLU-PRO上的实验表明,我们的方法 consistently优于传统基于SFT的方法,使学生模型性能超越其教师。本工作凸显了通过结构化自监督奖励学习实现可扩展、高效蒸馏的潜力,减少对外部奖励监督的依赖。
引用
@article{arxiv.2502.19557,
title = {Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?},
author = {Yudi Zhang and Lu Wang and Meng Fang and Yali Du and Chenghua Huang and Jun Wang and Qingwei Lin and Mykola Pechenizkiy and Dongmei Zhang and Saravan Rajmohan and Qi Zhang},
journal= {arXiv preprint arXiv:2502.19557},
year = {2025}
}
备注
14 pages, 7 figures