中文

学会预见:揭示同策略蒸馏的解锁效率

计算与语言 2026-05-22 v3

摘要

同策略蒸馏(OPD)已成为大语言模型的一种高效后训练范式。然而,现有研究大多将这种优势归因于更密集、更稳定的监督信号,而OPD效率背后的参数级机制仍不明确。在这项工作中,我们认为OPD的效率源于一种“预见”形式:它在训练早期就建立了一条朝向最终模型的稳定更新轨迹。这种预见体现在两个方面。首先,在模块分配层面,OPD识别出边际效用低的区域,并将更新集中在对于推理更为关键的模块上。其次,在更新方向层面,OPD表现出更强的低秩集中性,其主导子空间在训练早期就与最终更新子空间高度对齐。基于这些发现,我们提出了EffOPD,这是一种即插即用的加速方法,通过自适应选择外推步长并沿当前更新方向移动来加速OPD。EffOPD无需额外的可训练模块或复杂的超参数调优,即可实现平均3倍的训练加速,同时保持可比的最终性能。总体而言,我们的发现为理解OPD的效率提供了一个参数动力学视角,并为设计更高效的大语言模型后训练方法提供了实践见解。

关键词

引用

@article{arxiv.2605.11739,
  title  = {Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation},
  author = {Yuchen Cai and Ding Cao and Liang Lin and Chunxi Luo and Xin Xu and Kai Yang and Weijie Liu and Saiyong Yang and Tianxiang Zhao and Guangzhong Sun and Guiquan Liu and Junfeng Fang},
  journal= {arXiv preprint arXiv:2605.11739},
  year   = {2026}
}