SODA:面向大语言模型的半在-policy 黑盒蒸馏
机器学习
2026-04-24 v3 计算与语言
摘要
大语言模型的黑盒知识蒸馏面临严格的权衡。简单的离-policy 方法(如序列级知识蒸馏)难以纠正学生模型内在的错误。完全在-policy 方法(如生成对抗蒸馏)通过对抗训练解决此问题,但引入了众所周知的训练不稳定性和沉重的计算开销。为解决这一困境,我们提出了SODA(Semi On-policy Distillation with Alignment,即半在-policy 蒸馏与对齐),这是一种高度有效的替代方案,灵感来自前沿教师与相对较小的基础模型之间固有的能力差距。由于紧凑学生模型的天然零-shot 回应几乎远逊于强大教师的目标,因此,我们可以仅通过将教师的最优回应与学生输出的一时间静态快照配对,构建出高度有效的对比信号。这表明,仅通过让小学生暴露于其自身静态劣势行为,即可实现高质量的分布对齐,从而无需昂贵的动态 rollout 和脆弱的对抗平衡。广泛的评估覆盖四个紧凑的 Qwen2.5 和 Llama-3 模型,验证了这种半在-policy 范式。SODA 在 15 个 16 个基准结果中匹配或超越了最新方法。更重要的是,它在实现卓越蒸馏质量的同时,训练速度快 10 倍,峰值 GPU 内存消耗降低 27%,完全消除了对抗不稳定性。
引用
@article{arxiv.2604.03873,
title = {SODA: Semi On-Policy Black-Box Distillation for Large Language Models},
author = {Xiwen Chen and Jingjing Wang and Wenhui Zhu and Peijie Qiu and Xuanzhao Dong and Hejian Sang and Zhipeng Wang and Alborz Geramifard and Feng Luo},
journal= {arXiv preprint arXiv:2604.03873},
year = {2026}
}