f-OPD:基于新鲜度感知控制的长期序列在-policy蒸馏稳定方法
机器学习
2026-05-19 v1 人工智能
摘要
规模化的on-policy蒸馏(OPD)为大型语言模型(LLM)带来了一个根本性矛盾:需要异步执行以提高系统效率,但结构上偏离理想的on-policy目标。为解决此挑战,我们在理论上将目标差异分解为滚动漂移和监督漂移,分别捕捉学生滚动和教师上下文的陈旧性。基于此,我们引入一个样本级别的新鲜度分数,用于量化缓冲样本相对于on-policy目标的可靠性。借助此信号,我们进一步提出f-OPD,一种新型框架,自适应地调节陈旧样本的影响并约束在异步训练下累积的策略漂移。我们在推理、工具使用和编码代理任务上进行评估,这些任务的交互时段逐渐增加。f-OPD在保持异步执行的吞吐量优势的同时,始终实现与同步优化相当的任务性能。我们的结果为OPD实现性能-效率权衡的首要配方,为大规模agentic后训练铺平了道路。
关键词
引用
@article{arxiv.2605.17862,
title = {$\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control},
author = {Xianwei Chen and Shimin Zhang and Jibin Wu},
journal= {arXiv preprint arXiv:2605.17862},
year = {2026}
}