中文

混合策略蒸馏:推理压缩

高能天体物理现象 2026-05-12 v1 星系天体物理

摘要

以推理为中心的大型语言模型(LLM)通过生成中间推理轨迹实现卓越性能,但往往产生过多的 token 使用量和高的推理解码成本。我们观察到,对于相同问题,较大的推理模型常能产生更简洁的轨迹,而较小的推理模型倾向于生成更长且更冗余的轨迹。这在实际部署中尤其 problematic,因为内存、延迟和 serving 成本约束常偏好较小模型。我们的观察表明,推理压缩可从大模型传递给小模型,而非通过显式长度约束来强制实现。基于此洞见,我们提出混合策略蒸馏(MPD),一种将较大模型的简洁推理行为传递给较小模型的框架,通过蒸馏教师压缩后的学生轨迹来实现。不同于基于策略的蒸馏,该方法不使学生依赖于教师对冗长学生轨迹的分布对齐,也不依赖教师生成的轨迹而可能出现的分布不匹配。相反,MPD 结合了两者的优势:给定学生抽样轨迹后,教师将其重写为更简洁的推理轨迹,随后学生通过 KL 基于压缩轨迹进行训练。这既保留了学生策略的探索,又注入了教师引导的压缩。实验在 Qwen3-1.7B 上表明,MPD 可将 token 使用量降低最高 27.1%,同时在多个推理基准中提升性能,展示了一种高效进行小模型推理的有效方法。

关键词

引用

@article{arxiv.2605.08775,
  title  = {Chasing the neutrino blazar candidates II: SED modeling with hadronic model},
  author = {Hubing Xiao and Zhihao Ouyang and Lili Yang and Jingtian Zhu and Minfeng Gu and Liang Chen and Shaohua Zhang and Zhijian Luo and Junhui Fan},
  journal= {arXiv preprint arXiv:2605.08775},
  year   = {2026}
}

备注

17 pages, 8 figures, 7 tables; Accepted to ApJ