解构 OPD:大型语言模型的 length inflation 与稳定化策略
机器学习
2026-04-10 v1 人工智能
计算与语言
摘要
在策略蒸馏(OPD)中,学生模型在其自身诱导分布下进行训练,同时利用来自更强教师的监督。我们识别了 OPD 的一种失效模式:随着训练进行,策略性 rollout 可能发生突然的 length inflation,导致截断轨迹占主导地位。这种截断崩溃伴随突然的重复饱和,导致偏差的梯度信号,从而引发严重的训练不稳定和验证性能的显著下降。我们将此问题归因于学生诱导的数据收集与蒸馏目标之间的相互作用,该目标隐式偏好长且重复的 rollout。为解决此问题,我们提出 StableOPD 框架,结合参考基准的分布约束和 rollout 混合蒸馏。这两者共同缓解了由重复导致的 length inflation,并进一步稳定了 OPD 训练。在多个数学推理数据集上,我们的方法防止了截断崩溃,稳定了训练动力学,并平均提升了 7.2% 的性能。
引用
@article{arxiv.2604.08524,
title = {What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal},
author = {Stephen Cheng and Sarah Wiegreffe and Dinesh Manocha},
journal= {arXiv preprint arXiv:2604.08524},
year = {2026}
}
备注
9 pages + appendix, 7 figures