中文

外科学后训练:基于近端策略蒸馏的推理知识保留

计算与语言 2026-05-19 v2 人工智能

摘要

通过后训练向大型语言模型(LLM)注入新的推理知识常会导致灾难性遗忘。近期研究强调在策略数据方面的重要性,但指出KL散度在缓解遗忘方面效果不佳。相反,我们通过分析和实证研究表明,KL约束的奖励公式在后训练期间实际起到了关键的知识保留作用。这促使我们提出外科学后训练(SPOT),这是一种为高效推理同时保留先前知识的近端策略蒸馏框架。SPOT包含(1)采用Oracle的surgically纠正错误步骤的微观编辑数据管道,生成近端策略数据;(2)用于增强推理和缓解遗忘的基于奖励的二元交叉熵目标。实验方面,仅通过4k个纠正后的数学数据对,SPOT在域内和域外任务中平均提高Qwen3-8B的准确率6.2%,仅需16分钟在8x H800 GPU上的模型训练。此外,SPOT为后续强化学习提供了更优的初始化,显著提升了性能上限。代码:https://github.com/Visual-AI/SPoT

关键词

引用

@article{arxiv.2603.01683,
  title  = {Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention},
  author = {Wenye Lin and Kai Han},
  journal= {arXiv preprint arXiv:2603.01683},
  year   = {2026}
}

备注

21 pages