面向语言模型的单策略上下文蒸馏
计算与语言
2026-03-24 v2
摘要
上下文蒸馏使语言模型能够将上下文中的知识内化到参数中。本文提出单策略上下文蒸馏(OPCD)框架,构建单策略蒸馏与上下文蒸馏的桥梁,通过在自身生成的轨迹上训练学生模型,同时最小化对抗性克隆-库尔金散度(KL)以匹配基于上下文条件的教师模型。我们在两个重要应用场景上验证了OPCD的有效性:经验知识蒸馏中,模型从历史解决方案轨迹中提取并巩固可迁移知识;系统提示蒸馏中,模型内化编码在优化提示中所包含的有益行为。跨数学推理、文本游戏和领域特定任务,OPCD始终超越基线方法,在保持更好样本外能力的同时实现更高任务准确率。我们进一步表明OPCD支持有效的跨规模蒸馏,较小的学生模型可从较大的教师模型中内化经验知识。
引用
@article{arxiv.2602.12275,
title = {On-Policy Context Distillation for Language Models},
author = {Tianzhu Ye and Li Dong and Xun Wu and Shaohan Huang and Furu Wei},
journal= {arXiv preprint arXiv:2602.12275},
year = {2026}
}