中文

近确定性结构化输出的在策略蒸馏中的外推悬崖

机器学习 2026-05-12 v1 计算与语言

摘要

在策略蒸馏(OPD)广泛用于大语言模型的后训练。当使用奖励外推系数λ > 1时,学生模型可以在领域内超越教师模型,但超过阈值λ*后,同一更新步骤会在结构化输出任务上违反输出契约。在单位置伯努利简化中,我们推导出一个闭式的基于基线的裁剪安全阈值λ*(p,b,c),该阈值由三个可测量量决定:教师模态概率、热启动质量和重要性采样裁剪强度。在λ*之上,外推不动点离开裁剪安全区域,使训练从格式保持变为格式崩溃。我们将该规则扩展到校准的K元列表式JSON任务,其中单个绑定等价类主导输出契约,且SFT保留了解析余量。在Amazon Fashion上,三个预注册测试——细粒度悬崖区间、预算扩展测试和小裁剪交叉预测——均落在其锁定预测窗口内,小裁剪值与网格分辨率以下的闭式预测匹配。在略低于λ*处运行,ListOPD使1.7B参数的Qwen3学生模型在领域内与8B参数的SFT基线达到同等水平,而参数量仅为后者的五分之一。增益主要来自格式遵循:解析输出的NDCG@1在λ上保持平稳,而解析有效性在预测边界处急剧变化。悬崖诊断与评分标准无关,而同等性声明使用了Gemini评分的标准,并继承了该评估器的暴露风险。

关键词

引用

@article{arxiv.2605.08737,
  title  = {The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs},
  author = {Xin Li and Hao Jiang and Annan Wang and Yichi Zhang and Chau Yuen},
  journal= {arXiv preprint arXiv:2605.08737},
  year   = {2026}
}