Probe Pruning:通过模型探测实现 LLM 动态剪枝
计算与语言
2025-02-24 v1 人工智能
机器学习
摘要
我们提出了 Probe Pruning(PP),这是一种用于在大型语言模型(LLM)上进行在线、动态结构化剪枝的新框架,适用于批量处理方式。PP 利用了以下洞见:并非所有样本和标记对模型输出都 equally重要,通过对每个批量中少量样本进行探测,能够有效识别关键权重,从而为不同批量量身定制动态剪枝。PP 包含三个主要阶段:探测、历史信息化剪枝和完整推理。在探测阶段,PP 选择一小组基于残差重要性的隐藏状态,以运行模型的前几层。在历史信息化剪枝阶段,PP 将探测状态与历史状态战略性地集成。随后,根据集成状态和 PP 重要性评分(该评分是专为评估每个权重通道在保持性能方面的重要性而开发的指标),对权重进行结构化剪枝。在最终阶段,将在剩余权重上进行完整推理。PP 的一个主要优势是与现有模型的兼容性,因为它无需额外的神经网络模块或微调。对 LLaMA-2/3 和 OPT 模型进行的全面评估表明,即使仅使用 1.5% 的 FLOPs,PP 也能显著提升大型语言模型的结构化剪枝效率。例如,在以 WikiText2 为评估基准的 LLaMA-2-7B 上,PP 在 40% 剪枝比例下,性能下降与运行时减少比例的比值比当前最先进的方法低 2.56 倍。我们的代码已公开于 https://github.com/Qi-Le1/Probe_Pruning。
关键词
引用
@article{arxiv.2502.15618,
title = {Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing},
author = {Qi Le and Enmao Diao and Ziyan Wang and Xinran Wang and Jie Ding and Li Yang and Ali Anwar},
journal= {arXiv preprint arXiv:2502.15618},
year = {2025}
}
备注
ICLR 2025