POP:面向高效大模型推理的仅填充剪枝
计算与语言
2026-04-17 v2 人工智能
计算机视觉与模式识别
摘要
大语言模型(LLM)和视觉语言模型(VLM)已展现出惊人的能力,但其部署受限于显著的计算成本。现有的结构化剪枝方法虽硬件高效,却常因精度显著下降而受限。本文认为,这一失败源于忽视填充阶段和解码阶段之间非对称角色的无阶段敏感剪枝方法。通过引入虚拟门机制,我们的重要性分析揭示:深层网络对下一词预测(解码)至关重要,但在上下文编码(填充)中基本冗余。基于这一洞见,我们提出预填-仅剪枝(Prefill-Only Pruning, POP),一种面向阶段的推理策略,在计算密集型填充阶段安全地省略深层网络,同时保留完整模型以适应敏感的解码阶段。为实现阶段间的平滑过渡,我们引入独立的 Key-Value(KV)投影以维持缓存完整性,并提出边界处理策略确保首个生成词的精度。广泛的实验在 Llama-3.1、Qwen3-VL 和 Gemma-3 系列模型及多模态任务上表明,POP 在填充延迟上可实现最高 1.37 倍加速,同时保持最小精度损失,有效突破了现有结构化剪枝方法在精度与效率之间权衡的局限。
引用
@article{arxiv.2602.03295,
title = {POP: Prefill-Only Pruning for Efficient Large Model Inference},
author = {Junhui He and Zhihui Fu and Jun Wang and Qingan Li},
journal= {arXiv preprint arXiv:2602.03295},
year = {2026}
}