少即是多:基于早停滚动的策略梯度蒸馏
机器学习
2026-05-27 v1 人工智能
摘要
基于策略的蒸馏最近作为标准序列级模仿学习的有前景的替代方案, 通过对教师模型对其自身滚动结果进行评分来训练学生模型。然而,我们观察到该范式中出现“离策略教师衰减”问题:对于后续标记,由于学生的早期轨迹作为上下文偏离教师分布,教师产生纠错评分的能力会衰减,甚至可能退化为在预训练阶段学习的标记完成行为。我们经验性地验证了这一问题,并提出了早停滚动 (ESR) 以解决其问题:一种简单而有效的蒸馏策略,仅限制滚动生成于前n个响应标记。我们表明,ESR 在模型规模、家族、任务和训练 regime 方面均超越了完整滚动 OPD 的性能,并表现出更高的 GPU 效率和训练稳定性,尤其是在跨模型家族场景下。我们进一步探讨了这一意想不到的性能背后的机制,发现ESR的“级联对齐”和“子模式承诺”效应可能解释其有效性,甚至有时能超过教师模型的性能。此外,我们表明这种基于位置的标记选择策略无法完全由 KL 散度和熵信号来解释。
引用
@article{arxiv.2605.27028,
title = {Less is More: Early Stopping Rollout for On-Policy Distillation},
author = {Zhou Ziheng and Jiaqi Li and Huacong Tang and Ying Nian Wu and Demetri Terzopoulos},
journal= {arXiv preprint arXiv:2605.27028},
year = {2026}
}