中文

基于输入引导的大语言模型块级剪枝

计算与语言 2025-11-05 v1

摘要

随着大语言模型(LLM)计算需求的不断增长,提高推理效率日益成为实际部署的关键瓶颈。深度剪枝作为一种通过删除转换器层来降低大语言模型计算成本的有前景方法,已逐渐受到关注。然而,现有方法通常依赖固定的块掩码,可能在不同任务和输入上导致次优性能。在本论文中,我们提出了 IG-Pruning,这是一种新颖的输入感知的块级剪枝方法,可在推理时动态选择层掩码。我们的方法包含两个阶段:(1)通过语义聚类和 L0 优化发现多样化的掩码候选;(2)实现无需大量训练的高效动态剪枝。实验结果表明,我们的方法持续优于领先的静态深度剪枝方法,特别适用于资源受限的部署场景。

关键词

引用

@article{arxiv.2511.02213,
  title  = {IG-Pruning: Input-Guided Block Pruning for Large Language Models},
  author = {Kangyu Qiao and Shaolei Zhang and Yang Feng},
  journal= {arXiv preprint arXiv:2511.02213},
  year   = {2025}
}

备注

Accepted to EMNLP 2025. Code is available at https://github.com/ictnlp/IG-Pruning