混合策略蒸馏:推理压缩
高能天体物理现象
2026-05-12 v1 星系天体物理
摘要
以推理为中心的大型语言模型(LLM)通过生成中间推理轨迹实现卓越性能,但往往产生过多的 token 使用量和高的推理解码成本。我们观察到,对于相同问题,较大的推理模型常能产生更简洁的轨迹,而较小的推理模型倾向于生成更长且更冗余的轨迹。这在实际部署中尤其 problematic,因为内存、延迟和 serving 成本约束常偏好较小模型。我们的观察表明,推理压缩可从大模型传递给小模型,而非通过显式长度约束来强制实现。基于此洞见,我们提出混合策略蒸馏(MPD),一种将较大模型的简洁推理行为传递给较小模型的框架,通过蒸馏教师压缩后的学生轨迹来实现。不同于基于策略的蒸馏,该方法不使学生依赖于教师对冗长学生轨迹的分布对齐,也不依赖教师生成的轨迹而可能出现的分布不匹配。相反,MPD 结合了两者的优势:给定学生抽样轨迹后,教师将其重写为更简洁的推理轨迹,随后学生通过 KL 基于压缩轨迹进行训练。这既保留了学生策略的探索,又注入了教师引导的压缩。实验在 Qwen3-1.7B 上表明,MPD 可将 token 使用量降低最高 27.1%,同时在多个推理基准中提升性能,展示了一种高效进行小模型推理的有效方法。
引用
@article{arxiv.2605.08775,
title = {Chasing the neutrino blazar candidates II: SED modeling with hadronic model},
author = {Hubing Xiao and Zhihao Ouyang and Lili Yang and Jingtian Zhu and Minfeng Gu and Liang Chen and Shaohua Zhang and Zhijian Luo and Junhui Fan},
journal= {arXiv preprint arXiv:2605.08775},
year = {2026}
}
备注
17 pages, 8 figures, 7 tables; Accepted to ApJ