Lightning OPD:基于离线策略蒸馏的大规模推理模型高效后训练方法
机器学习
2026-05-11 v2 人工智能
摘要
在策略蒸馏 (OPD) 中,训练过程中需要持续依赖活生生的教师服务器,这会导致巨大的基础设施开销。我们研究是否存在可能通过预计算SFT rollout的教师对数概率并在训练期间重用的方式,实现离线OPD。我们发现,仅仅粗暴地这样做无法可靠地匹配标准OPD,追根溯源于一个此前被忽视的条件——我们称之为教师一致性,要求监督微调和OPD使用相同的教师。违反这一条件会引入梯度偏差,使离线和在线OPD的性能均受到损害。基于这一洞见,我们提出Lightning OPD,一种离线策略蒸馏框架,通过强制教师一致性消除对活生生教师服务器的需求。我们证明,在教师一致性条件下,Lightning OPD与标准OPD具有相同的极值,梯度差异受到可控约束,并产生一种隐式的正则化效应,有助于防止策略漂移。在数学推理和代码生成任务上进行实验表明,Lightning OPD在保持与标准OPD相当性能的同时,实现了4.0倍的训练效率。以SFT初始化的Qwen3-8B-Base模型为起点,Lightning OPD仅用30个GPU小时即可达到AIME 2024的69.9%。Lightning OPD还扩展到MoE架构,在单个8xH100节点上将Qwen3-30B-A3B训练到AIME 2024的71.0%,显著降低了大语言模型后训练在学术研究中的门槛。我们的代码已发布于https://github.com/jet-ai-projects/Lightning-OPD。
引用
@article{arxiv.2604.13010,
title = {Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation},
author = {Yecheng Wu and Song Han and Hai Cai},
journal= {arXiv preprint arXiv:2604.13010},
year = {2026}
}