中文

重审 LLM 剪枝对测试时间扩展的有效性

人工智能 2026-05-29 v2 计算与语言 机器学习

摘要

大型语言模型(LLM)通过测试时间计算扩展(TTS)表现出惊人的推理能力,在数学和编码基准测试中取得优异性能。与此同时,模型压缩研究发展出寻找删除冗余/有害参数而不牺牲任务性能的剪枝方法。这两项研究进步的交汇为本工作奠定了基础。针对推理型LLM,先前的工作表明,结构化剪枝(删除整个层块的方法)显著降低TTS推理性能。然而,在本工作中,我们重审了这一假设,探讨了非结构化剪枝(仔细删除仅某些冗余/有害权重的方法)是否 exhibit类似限制。惊讶的是,我们在两个推理LLM上进行的四项推理基准测试的广泛实验中,一致显示,非结构化剪枝能够增强TTS性能,甚至有时可以超过未剪枝的完整权重LLM。此外,我们还经验性地研究了不同层级稀疏分配策略的影响,这是实例化这些非结构化方法的重要参数选择。这些发现挑战了剪枝总是降低TTS性能的常规观念,实际上表明,仔细进行的剪枝可以保留TTS有效性。

关键词

引用

@article{arxiv.2604.25098,
  title  = {Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling},
  author = {Ocean Monjur and Shahriar Kabir Nahin and Anshuman Chhabra},
  journal= {arXiv preprint arXiv:2604.25098},
  year   = {2026}
}