通过思维链重建精确剪枝推理模型
人工智能
2026-05-05 v2
摘要
像DeepSeek-R1这样的推理语言模型在推理时会产生很长的思维链痕迹,这使得它们在大规模部署时成本高昂。我们表明,使用神经网络剪枝等压缩技术会比在典型的语言建模任务中造成更大的性能损失,并且在某些情况下,由于它们导致模型产生更多的思维令牌但性能更差,反而会使模型变慢。我们证明,这部分是由于标准的LLM剪枝方法通常侧重于输入重建,而推理是一个以解码为主的任务。我们引入了一个简单的、即插即用的修复方法:在剪枝过程中,我们联合重建来自输入和模型在线策略思维链痕迹的激活。这种“推理感知压缩”(RAC)无缝集成到现有的剪枝工作流程(如SparseGPT)中,并显著提升了它们的性能。重现本文结果的代码可在以下网址找到:https://github.com/RyanLucas3/RAC
引用
@article{arxiv.2509.12464,
title = {Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction},
author = {Ryan Lucas and Kayhan Behdin and Zhipeng Wang and Qingquan Song and Shao Tang and Rahul Mazumder},
journal= {arXiv preprint arXiv:2509.12464},
year = {2026}
}